Исследователи представили метод MIST (Selective Context Preference Optimization), который решает проблему слепого доверия языковых моделей к внешним данным. Вместо того чтобы полностью игнорировать контекст, модель обучается оценивать его достоверность. Это позволяет ИИ эффективно использовать полезную информацию, отсеивая вводящие в заблуждение сигналы, что критически важно для надежности RAG-систем и агентных решений.

Основная сложность при работе с внешними данными заключается в том, что модели склонны либо безоговорочно доверять любому источнику, либо игнорировать его вовсе. Второй подход делает систему бесполезной в задачах, требующих актуальных знаний. Авторы работы переформулировали задачу как «избирательное доверие», используя человеческую разметку для обучения модели распознавать, когда контекст действительно несет ценность, а когда — искажает факты.

Метод опирается на оптимизацию предпочтений (Preference Optimization), адаптированную для оценки контекстных сигналов. В ходе экспериментов модель, обученная с помощью MIST, продемонстрировала способность сохранять точность ответов даже при наличии намеренно сгенерированных ложных данных в контекстном окне. Это снижает риск галлюцинаций, вызванных некорректным поиском или манипуляцией входными данными.

Ключевые факты

  • Метод MIST (Selective Context Preference Optimization) направлен на повышение устойчивости LLM к недостоверным внешним данным.
  • Алгоритм использует человеческую разметку для обучения модели различению полезного контекста от вредоносного или ошибочного.
  • Исследование решает проблему «отказа от контекста», при которой модель становится нечувствительной к важной информации из-за избыточной фильтрации.
  • Подход значительно снижает вероятность того, что один неверный сигнал приведет к генерации ошибочного ответа всей системой.