Исследователи представили SciCode-Verified — обновленный набор данных для оценки навыков LLM в написании научного кода. Анализ показал, что существующие бенчмарки содержат значительное количество дефектов, которые приводят к ложноотрицательным результатам. Исправление этих ошибок демонстрирует, что современные модели справляются с научными задачами программирования гораздо эффективнее, чем считалось ранее, что требует пересмотра подходов к тестированию ИИ в специализированных областях.
Традиционные бенчмарки часто полагаются на автоматическую проверку кода, которая не учитывает специфику научных вычислений, таких как работа с плавающей запятой, сложные математические библиотеки или специфические форматы данных. Ошибки в тестовых кейсах или неверные условия верификации приводили к тому, что даже высокопроизводительные модели получали заниженные оценки, не отражающие их реальную способность решать прикладные задачи в физике, химии или анализе данных.
Авторы SciCode-Verified провели ручную верификацию и очистку данных, устранив неоднозначности и исправив некорректные условия выполнения тестов. Это позволило создать более надежный инструмент для измерения прогресса моделей в области научного программирования. Результаты подчеркивают важность качества данных в бенчмарках: даже небольшое количество «шумных» или ошибочных примеров может существенно исказить общую картину производительности нейросетей.
Ключевые факты
- SciCode-Verified исправляет критические дефекты в существующих наборах данных для оценки научного кодинга.
- Автоматизированные тесты в старых бенчмарках часто ошибочно помечали корректные решения как неверные из-за неточностей в условиях верификации.
- Исследование доказывает, что реальная эффективность LLM в написании научного кода выше, чем показывают текущие метрики.
- Новый бенчмарк фокусируется на задачах, требующих глубокого понимания математических библиотек и научной специфики программирования.