Платформа Artificial Analysis представила версию 4.1.1 своего индекса Intelligence Index, обновляя подходы к сравнительному анализу больших языковых моделей. Обновление затрагивает методики оценки качества ответов, скорости генерации и стоимости инференса, предоставляя стандартизированные метрики для объективного сопоставления ведущих проприетарных и открытых моделей на рынке, что критически важно для выбора архитектуры под конкретные бизнес-задачи.

Новая методология фокусируется на устранении предвзятости при оценке моделей, внедряя более строгие протоколы тестирования на различных типах запросов — от написания кода до творческого письма и логических задач. Система учитывает не только точность ответов, но и задержку (latency) при работе через API, что позволяет компаниям точнее прогнозировать производительность своих ИИ-решений в реальных условиях эксплуатации.

Разработчики индекса пересмотрели весовые коэффициенты для различных категорий задач, чтобы лучше отражать текущие сценарии использования ИИ в корпоративном секторе. Особое внимание уделено прозрачности данных: теперь пользователи могут детально изучить, как именно формируется итоговый рейтинг, включая используемые наборы данных и критерии оценки, что повышает доверие к результатам бенчмаркинга в условиях быстрого обновления моделей.

Ключевые факты

  • Версия 4.1.1 индекса включает обновленные алгоритмы взвешивания для оценки качества ответов моделей.
  • В методологию добавлены уточненные параметры измерения задержки (Time to First Token) и пропускной способности (Tokens per Second).
  • Обновление охватывает широкий спектр моделей, включая актуальные релизы от OpenAI, Anthropic, Google и ведущих open-source проектов.
  • Методология теперь содержит расширенные критерии для оценки логических способностей и навыков программирования.
  • Все данные бенчмарков доступны для публичного аудита, что позволяет верифицировать результаты независимым исследователям.