Модель Qwen2.5-Max заняла первую строчку в обновленном Agentic Index от Artificial Analysis, обойдя конкурентов в задачах на автономное выполнение сложных многошаговых процессов. Исследование оценивает способность моделей эффективно использовать инструменты, планировать действия и достигать целей в агентских сценариях, где требуется высокая точность следования инструкциям и надежность при работе с внешними API.

Рейтинг Agentic Index фокусируется на специфических навыках, необходимых для построения ИИ-агентов, а не просто на качестве генерации текста или написании кода. В ходе тестирования модели проходят через серию задач, требующих взаимодействия с инструментами, обработки ошибок и корректировки стратегии в реальном времени. Лидерство Qwen2.5-Max подчеркивает значительный прогресс в архитектурной оптимизации моделей для агентских рабочих процессов.

Результаты показывают, что разрыв между топовыми проприетарными моделями сокращается, а фокус разработчиков смещается с чистого инференса на повышение надежности агентов. Высокие показатели в агентских тестах напрямую коррелируют с эффективностью автоматизации бизнес-процессов, где требуется минимизация галлюцинаций и строгое соблюдение последовательности действий при работе с данными.

Ключевые факты

  • Qwen2.5-Max заняла первое место в Agentic Index, сместив предыдущих лидеров рынка.
  • Методология рейтинга оценивает способность моделей успешно завершать автономные задачи с использованием инструментов.
  • Тестирование включает оценку точности планирования и обработки промежуточных результатов в многошаговых цепочках.
  • Данные обновляются платформой Artificial Analysis, специализирующейся на бенчмаркинге производительности и стоимости LLM.