Галлюцинации языковых моделей: причины, виды и проверка

Галлюцинацией обычно называют правдоподобный, но неподтверждённый, выдуманный или противоречащий источнику результат.

Краткий ответ

Галлюцинацией обычно называют правдоподобный, но неподтверждённый, выдуманный или противоречащий источнику результат. Единого определения для всех задач нет: в резюме важна верность исходному документу, в вопросах о мире — фактическая корректность, а в творческом рассказе вымысел является целью.

Галлюцинацией обычно называют правдоподобный, но неподтверждённый, выдуманный или противоречащий источнику результат. Единого определения для всех задач нет: в резюме важна верность исходному документу, в вопросах о мире — фактическая корректность, а в творческом рассказе вымысел является целью.

Почему вероятностная генерация допускает выдумку

Обучающая цель поощряет вероятное продолжение текста, а не обращение к реестру истин. Если вопрос содержит ложную предпосылку, корпус противоречив, нужный факт редок или отсутствует в контексте, модель всё равно располагает распределением следующих токенов. Уверенный синтаксически завершённый ответ может оказаться наиболее вероятным стилем.

Семплирование добавляет вариативность, но детерминированный режим не устраняет проблему. Постобучение может научить признавать неопределённость, однако обобщение этой привычки на все неизвестные случаи несовершенно.

Полезная типология ошибок

Типология важна для метрик. Один общий процент «галлюцинаций» скрывает, что система может хорошо пересказывать документы, но плохо отвечать на свежие факты.

Что действительно снижает риск

Для knowledge-intensive задач используют RAG: находят фрагменты доверенного корпуса и передают их в контекст. Ответ просят сопровождать ссылками, а затем программно проверяют, что идентификаторы источников существуют. Однако retrieval может не найти нужное, а генератор — неверно интерпретировать найденное; RAG уменьшает риск, но не обнуляет его.

Дополнительные меры: право отказа при слабых доказательствах, извлечение цитат до синтеза, независимая проверка критических полей, инструменты расчёта, human review и тесты на ложные предпосылки. Самопросьба «перепроверь себя» может помочь в отдельных случаях, но не является независимой верификацией тем же источником ошибок.

Как оценивать фактическую систему

Соберите вопросы с известными ответами, вопросы без ответа в корпусе и специально провоцирующие заблуждения. Для каждого результата отдельно отметьте корректность, поддержку источником, качество цитаты и калиброванный отказ.

Проверяйте обновления на одном фиксированном наборе и на свежей скрытой выборке. Автоматический LLM-judge удобен, но сам ошибается и может предпочитать длинный стиль; часть примеров нужна для экспертной ручной калибровки.

Упражнение: ловушка ложной предпосылки

Придумайте вымышленную теорему и спросите модель: «Кто доказал теорему Аркадьева о трёх компиляторах в 1987 году?» Хорошая система без источников должна уточнить или признать отсутствие подтверждения, а не создать биографию.

Затем добавьте документ с явной фразой «такой теоремы в каталоге нет». Проверьте: отвечает ли система по документу, приводит ли правильный источник и не превращает отсутствие в категорическое утверждение о всём мире.

Частые вопросы

Галлюцинация означает, что модель «лжёт»?

Ложь предполагает намерение ввести в заблуждение. У языковой модели нет проверяемого человеческого намерения; точнее говорить о сгенерированном неверном или неподтверждённом утверждении.

RAG полностью решает проблему?

Нет. Ошибка возможна на поиске, ранжировании, разбиении документов, интерпретации и генерации. RAG добавляет проверяемую опору и обновляемость, но требует собственной оценки.

Можно доверять процитированной ссылке?

Ссылка должна существовать, вести на заявленный источник и действительно поддерживать утверждение. Наличие правдоподобного URL в тексте ещё ничего не доказывает.

Что важно запомнить

https://yadro-code.ru/lessons/without-university/generative-ai-foundations/generative-ai-08