Исследователи проанализировали ограничения существующих бенчмарков для оценки больших языковых моделей. Текущие методы тестирования часто полагаются лишь на API-запросы и однократные промпты, игнорируя влияние внешних инструментов, таких как веб-поиск и работа с цитированием. Это приводит к искаженному представлению о надежности и безопасности моделей при их реальном развертывании в сложных агентных системах.

Основная проблема заключается в том, что большинство оценок проводятся в изолированной среде, которая не учитывает динамическую природу взаимодействия ИИ с внешними данными. Когда модель получает доступ к поисковым системам или базам знаний, её поведение, склонность к галлюцинациям и уязвимость к атакам могут существенно меняться. Стандартные метрики точности ответов не способны зафиксировать эти изменения, что создает ложное чувство готовности моделей к промышленному внедрению.

Авторы работы подчеркивают, что для адекватной оценки безопасности необходимо пересмотреть подходы к тестированию. Это включает в себя переход от статических наборов данных к динамическим сценариям, где учитываются многоходовые взаимодействия, проверка источников и контекстуальные изменения, возникающие при использовании инструментов поиска. Без внедрения таких комплексных методов оценки текущие показатели производительности остаются неполными и потенциально вводящими в заблуждение.

Ключевые факты

  • Большинство современных бенчмарков ограничены использованием только API-доступа и однократным выполнением промптов.
  • Использование инструментов веб-поиска и цитирования источников радикально меняет профиль безопасности и поведения LLM, что не учитывается в текущих тестах.
  • Основной метрикой в большинстве исследований остается точность ответа, которая не отражает риски, возникающие при агентном взаимодействии.
  • Исследование указывает на необходимость разработки новых протоколов тестирования, учитывающих многомодальность и использование внешних инструментов в реальных условиях эксплуатации.