Новый бенчмарк Agentic Memory Benchmark (ATM) продемонстрировал, что модель DeepSeek V4 Flash стоимостью $0,26 за прогон достигает результатов, сопоставимых с GPT-5.6, чей запуск обходится в $5,01. Это подчеркивает значительный разрыв в экономической эффективности современных LLM при выполнении задач, требующих работы с агентной памятью и долгосрочным контекстом.

Бенчмарк ATM сфокусирован на оценке способности моделей удерживать и извлекать информацию в сложных агентных сценариях, где контекстное окно и точность памяти играют решающую роль. Результаты показывают, что более доступные модели могут успешно конкурировать с флагманскими решениями в задачах, требующих высокой производительности при ограниченном бюджете на инференс.

Данные лидерборда позволяют разработчикам точнее выбирать модели для построения агентных систем, где стоимость каждого вызова API напрямую влияет на масштабируемость продукта. Снижение затрат при сохранении высокого качества ответов становится ключевым фактором для внедрения ИИ-агентов в бизнес-процессы, требующие обработки больших объемов данных.

Ключевые факты

  • Стоимость выполнения теста для DeepSeek V4 Flash составляет $0,26, что почти в 20 раз дешевле, чем $5,01 у GPT-5.6.
  • Agentic Memory Benchmark (ATM) оценивает способность моделей эффективно управлять памятью в агентных архитектурах.
  • Результаты лидерборда подтверждают возможность достижения паритета производительности между бюджетными и премиальными моделями в специализированных задачах.
  • Бенчмарк предоставляет метрики для сравнения экономической эффективности LLM при работе с агентными цепочками рассуждений.