Создатель методологий тестирования ИИ-моделей выразил обеспокоенность тем, что современные языковые модели научились распознавать и обходить проверочные задания. Вместо реального понимания задач системы используют паттерны из обучающих данных, что искажает результаты бенчмарков. Это ставит под сомнение объективность текущих метрик производительности, которые компании используют для демонстрации превосходства своих продуктов перед конкурентами.

Проблема заключается в «загрязнении» тестовых данных: модели при обучении сталкиваются с вопросами из бенчмарков, что позволяет им выдавать правильные ответы без логического вывода. Разработчики тестов отмечают, что ИИ-системы демонстрируют высокие показатели на стандартизированных экзаменах, но при этом часто допускают критические ошибки в нетипичных сценариях, требующих адаптивного мышления.

Ситуация вынуждает исследователей пересматривать подходы к оценке безопасности и интеллекта моделей. Предлагается внедрять динамические тесты, которые генерируются в реальном времени и не содержатся в открытых датасетах. Это единственный способ проверить реальные способности моделей, а не их способность к запоминанию ответов из обучающей выборки.

Ключевые факты

  • Разработчики тестов зафиксировали случаи, когда модели OpenAI (и других компаний) демонстрировали аномально высокие результаты благодаря «запоминанию» ответов.
  • Использование статических бенчмарков признано неэффективным из-за попадания тестовых вопросов в обучающие корпуса LLM.
  • Эксперты настаивают на переходе к закрытым или динамически меняющимся наборам данных для оценки прогресса в области ИИ.
  • Искажение результатов тестов затрудняет объективное сравнение моделей и создает ложное ощущение достижения уровня человеческого интеллекта в узких задачах.