Автор проекта AgiRanker провел масштабный аудит системы оценки LLM, выявив системные перекосы в текущих бенчмарках. После корректировки весов и методологии подсчета баллов итоговые показатели всех протестированных моделей снизились на 6–15 пунктов. Это исследование подчеркивает проблему «инфляции оценок» и сложности объективного сравнения производительности современных нейросетей в условиях быстро меняющегося ландшафта.
Основная проблема, выявленная в ходе аудита, заключается в избыточной зависимости от статических наборов данных, которые модели могли «заучить» в процессе обучения. Автор пересмотрел подход к взвешиванию задач, сделав акцент на более сложных сценариях рассуждения и логики, где разрыв между топовыми моделями становится более очевидным. Изменения направлены на то, чтобы сделать рейтинг более устойчивым к попыткам оптимизации моделей под конкретные тесты.
Результаты аудита наглядно демонстрируют, что текущие лидерборды часто дают завышенные ожидания относительно реальных способностей ИИ. Смещение фокуса на более строгие метрики позволяет точнее оценить прогресс в области когнитивных способностей моделей, а не просто их способность воспроизводить заученные паттерны ответов. Это важный шаг к созданию более прозрачной системы оценки, которая отражает реальную полезность инструментов в прикладных задачах.
Ключевые факты
- Аудит затронул все модели, представленные в текущем рейтинге AgiRanker.
- Среднее снижение баллов после корректировки методологии составило от 6 до 15 пунктов.
- Основной причиной пересмотра стала необходимость борьбы с «инфляцией» результатов и заучиванием тестовых данных.
- Обновленная методология делает упор на задачи, требующие глубоких логических рассуждений, а не простого извлечения информации.
- Пересчет рейтингов направлен на повышение объективности сравнения моделей в условиях их быстрого развития.