Исследователи обнаружили, что использование LLM для автоматической генерации тестов существенно влияет на то, какая реализация алгоритма признается наиболее эффективной. В ходе экспериментов выяснилось, что выборка тестовых случаев, созданная моделью, может отдавать предпочтение конкретным архитектурным решениям, что ставит под сомнение объективность традиционных бенчмарков, основанных на ограниченных наборах данных для проверки корректности кода.

Проблема заключается в том, что LLM при генерации тестов могут неосознанно подстраиваться под специфические паттерны кода, которые они сами же и создают. Это приводит к «эффекту предвзятости», когда реализация, лучше всего проходящая сгенерированные тесты, не обязательно является оптимальной с точки зрения реальной производительности или надежности. В результате разработчики могут выбирать менее эффективные решения, полагаясь на результаты автоматизированного тестирования.

Данное открытие подчеркивает необходимость пересмотра подходов к валидации кода в эпоху генеративного ИИ. Исследователи предлагают внедрять более строгие методы верификации, включая комбинирование синтетических тестов с классическими наборами данных и проверку на «устойчивость» кода к различным типам тестовых сценариев, чтобы исключить влияние случайных факторов на итоговый выбор архитектуры.

Ключевые факты

  • Исследование показало, что смена набора тестов, сгенерированного LLM, может изменить лидера в рейтинге производительности реализаций.
  • Автоматическая генерация тестов вносит систематическую предвзятость, зависящую от обучающих данных модели.
  • Традиционные бенчмарки становятся менее надежными при оценке кода, написанного или оптимизированного с помощью ИИ.
  • Рекомендуется использовать гибридные подходы, сочетающие LLM-тесты с проверенными наборами данных для обеспечения объективности.