Исследователи проанализировали проблему загрязнения данных в популярных LLM, при которой тестовые вопросы из бенчмарков попадают в обучающие выборки. Это приводит к завышению показателей производительности моделей, так как нейросети фактически «запоминают» ответы, а не демонстрируют способность к рассуждению. Феномен ставит под сомнение объективность текущих методов оценки ИИ-систем и требует пересмотра подходов к валидации.
Основная сложность заключается в том, что интернет-данные, используемые для обучения, включают в себя репозитории с кодом, форумы и архивы, где уже содержатся ответы на вопросы из академических тестов. В результате модели показывают аномально высокие результаты на задачах, которые они могли видеть в процессе обучения. Это создает иллюзию прогресса, скрывая реальные ограничения моделей в решении новых, ранее не виденных задач.
Для решения проблемы предлагается внедрение динамических бенчмарков, вопросы в которых генерируются или обновляются в реальном времени. Такой подход позволяет исключить возможность «зазубривания» ответов и обеспечивает более точную оценку когнитивных способностей моделей. Без изменения методологии тестирования разработчики рискуют переоценить возможности своих систем, что критично при внедрении ИИ в сложные бизнес-процессы.
Ключевые факты
- Загрязнение данных (data contamination) приводит к тому, что модели показывают результаты, превышающие их реальные возможности на 10–20% в специфических тестах.
- Исследование подтверждает, что даже небольшое количество примеров из тестового набора в обучающей выборке существенно искажает итоговые метрики.
- Текущие статические бенчмарки перестают быть надежным инструментом для сравнения моделей из-за их повсеместного присутствия в открытых данных.
- Разработчикам рекомендуется использовать методы «отложенной проверки» (hold-out sets) и приватные наборы данных, которые не индексируются поисковыми системами.