Независимый исследователь провел аудит заявлений компании Anthropic относительно метрики RSI (Relative Skill Increase) в их последних моделях. Анализ ставит под сомнение корректность методологии, используемой для оценки прироста навыков, указывая на возможные искажения в интерпретации данных. Исследование подчеркивает важность прозрачности бенчмарков при сравнении производительности современных LLM в реальных задачах.

Автор материала детально разбирает архитектуру тестов, на которые ссылается разработчик, и сопоставляет их с результатами воспроизведения в контролируемых условиях. Основное внимание уделено тому, как именно формируются выборки для оценки и какие факторы могут приводить к завышению показателей эффективности при сравнении с конкурентными решениями. В работе также рассматриваются ограничения текущих подходов к тестированию моделей, которые часто не учитывают специфические паттерны использования в прикладных задачах.

Результаты проверки показывают, что заявленные Anthropic цифры могут быть чувствительны к изменению состава тестовых наборов данных. Это ставит вопрос о необходимости стандартизации бенчмарков, чтобы исключить предвзятость при демонстрации превосходства новых версий моделей над предыдущими итерациями или аналогами от других компаний.

Ключевые факты

  • Исследование сфокусировано на проверке метрики RSI, представленной Anthropic для оценки прогресса моделей.
  • Выявлены расхождения между маркетинговыми заявлениями и результатами независимого воспроизведения тестов.
  • Основная претензия касается методологии формирования тестовых выборок и интерпретации статистического прироста навыков.
  • Автор указывает на риск «подгонки» бенчмарков под конкретные архитектурные особенности моделей.
  • Работа призывает к более строгому аудиту публичных заявлений разработчиков ИИ-систем.