Исследователи представили D-Score — метрику для выявления галлюцинаций в больших языковых моделях, основанную на анализе геометрии скрытых активаций. Метод использует спектральную статистику, вычисляемую за один проход модели (forward pass), что позволяет эффективно определять фактологическую недостоверность ответов без необходимости в дополнительных обучающих выборках или сложных внешних проверках.
Традиционные подходы к борьбе с галлюцинациями часто требуют значительных вычислительных ресурсов или доступа к внешним базам знаний для верификации. D-Score фокусируется на внутренних представлениях модели, анализируя спектральные характеристики сигналов в скрытых слоях. Это позволяет системе «понимать», когда генерируемый текст противоречит информации, уже заложенной в весах нейросети, или не имеет под собой достаточных доказательств.
Применение данного метода дает возможность интегрировать механизмы самоконтроля непосредственно в процесс инференса. Поскольку расчет D-Score требует минимальных затрат ресурсов, он может стать эффективным инструментом для мониторинга качества ответов в реальном времени, повышая надежность систем, работающих на базе LLM в критически важных областях.
Ключевые факты
- D-Score вычисляется на основе спектрального анализа скрытых состояний нейронной сети.
- Метод требует выполнения всего одного прямого прохода (forward pass) для оценки достоверности.
- Алгоритм позволяет обнаруживать галлюцинации, которые противоречат внутренним представлениям модели.
- Подход не требует дообучения или использования внешних инструментов верификации данных.