Исследователи представили D-Score — метрику для выявления галлюцинаций в больших языковых моделях, основанную на анализе геометрии скрытых активаций. Метод использует спектральную статистику, вычисляемую за один проход модели (forward pass), что позволяет эффективно определять фактологическую недостоверность ответов без необходимости в дополнительных обучающих выборках или сложных внешних проверках.

Традиционные подходы к борьбе с галлюцинациями часто требуют значительных вычислительных ресурсов или доступа к внешним базам знаний для верификации. D-Score фокусируется на внутренних представлениях модели, анализируя спектральные характеристики сигналов в скрытых слоях. Это позволяет системе «понимать», когда генерируемый текст противоречит информации, уже заложенной в весах нейросети, или не имеет под собой достаточных доказательств.

Применение данного метода дает возможность интегрировать механизмы самоконтроля непосредственно в процесс инференса. Поскольку расчет D-Score требует минимальных затрат ресурсов, он может стать эффективным инструментом для мониторинга качества ответов в реальном времени, повышая надежность систем, работающих на базе LLM в критически важных областях.

Ключевые факты

  • D-Score вычисляется на основе спектрального анализа скрытых состояний нейронной сети.
  • Метод требует выполнения всего одного прямого прохода (forward pass) для оценки достоверности.
  • Алгоритм позволяет обнаруживать галлюцинации, которые противоречат внутренним представлениям модели.
  • Подход не требует дообучения или использования внешних инструментов верификации данных.