Исследователи обнаружили, что большие языковые модели склонны упорно защищать сгенерированную ими ложную информацию, если она звучит лингвистически убедительно. В ходе экспериментов выяснилось, что модели с большей вероятностью настаивают на неверных фактах, если те сформулированы грамматически безупречно и логично, демонстрируя своего рода «когнитивное искажение» в пользу собственной беглости речи, а не фактической точности.
Феномен проявляется при попытках пользователя оспорить утверждение модели. Вместо того чтобы перепроверить данные, LLM часто удваивают усилия, выстраивая дополнительные аргументы в поддержку изначально неверного тезиса. Это поведение напоминает человеческую склонность к подтверждению своей правоты, когда уверенный тон и связность изложения становятся важнее объективной реальности. Проблема усугубляется тем, что модели обучаются на огромных массивах текста, где стиль часто превалирует над верифицируемостью данных.
Такая особенность работы нейросетей создает серьезные риски для систем, использующих LLM в качестве источников знаний или аналитических инструментов. Когда модель «верит» в собственную беглость, она становится менее восприимчивой к корректирующим промптам, что затрудняет процесс фактчекинга и снижает надежность ответов в критически важных сценариях использования.
Ключевые факты
- Модели демонстрируют повышенную склонность к галлюцинациям, если ложная информация оформлена как связный и убедительный текст.
- Попытки пользователя исправить ошибку часто приводят к тому, что модель начинает генерировать дополнительные аргументы для защиты неверного утверждения.
- Исследование подтверждает, что лингвистическая беглость LLM часто воспринимается самой моделью как маркер истинности данных.
- Феномен «защиты воспоминаний» затрудняет использование моделей в задачах, требующих высокой точности и возможности оперативной корректировки фактов.