Оценка и бенчмарки
Запуск открытой платформы для тестирования моделей в задачах компьютерного управления
Проект CoArena представил сообществу открытую платформу для оценки способностей ИИ-моделей в задачах компьютерного управления (computer-use). Инструмент позволяет сравнивать производительность различных систем в реальных сценариях взаимодействия с графическим интерфейсом ОС, предоставляя стандартизированную среду для тестирования агентных возможностей, которые выходят за рамки классического текстового инференса и требуют навигации по экрану.
Стэнфорд опубликовал базу из 1000+ системных промптов популярных LLM
Исследователи из Стэнфордского университета представили System Prompt Index — открытую базу данных, содержащую более 1000 системных инструкций для ведущих языковых моделей, включая ChatGPT, Claude и Gemini. Проект позволяет изучить, как разработчики настраивают поведение ИИ, задают ограничения и определяют стилистику общения, предоставляя прозрачный взгляд на «внутреннюю кухню» современных чат-ботов.
Результаты DeepSeek V4 Flash в бенчмарке ARC-AGI
Модель DeepSeek V4 Flash продемонстрировала значимые результаты в ARC-AGI — одном из самых сложных тестов на проверку способности ИИ к абстрактному мышлению и обобщению. В отличие от стандартных задач на знание фактов, этот бенчмарк требует от нейросетей самостоятельного поиска закономерностей в визуальных головоломках, что является важным индикатором прогресса на пути к созданию общего искусственного интеллекта.
SABRE: автоматизированный пайплайн для стресс-тестирования мультимодальных моделей
Исследователи представили SABRE — масштабируемый фреймворк для автоматизированного тестирования Vision-Language моделей (VLM). Система преобразует текстовые описания задач в структурированные наборы данных для стресс-тестов, позволяя выявлять уязвимости моделей в контролируемых условиях. Решение решает проблему нехватки качественных бенчмарков, которые не успевают за темпами развития мультимодальных технологий, обеспечивая быструю и воспроизводимую оценку производительности ИИ.
Разработка собственного бенчмарка для оценки LLM: опыт создания Ed-O-Meter
Разработчик представил Ed-O-Meter — специализированный инструмент для оценки качества ответов больших языковых моделей. В отличие от стандартных публичных тестов, этот бенчмарк фокусируется на проверке точности и глубины аргументации в специфических предметных областях, позволяя компаниям объективно сравнивать производительность различных LLM при решении прикладных задач, где общие метрики часто оказываются недостаточно информативными.
GeoBenchLLM: новый стандарт оценки геопространственных навыков LLM
Исследователи представили GeoBenchLLM — комплексный бенчмарк для оценки способностей больших языковых моделей в работе с геопространственными данными. Инструмент объединяет двенадцать публичных наборов данных, охватывающих широкий спектр прикладных задач. Разработка призвана устранить ограничения существующих тестов, которые часто оценивают модели в узких, однородных условиях, не позволяя объективно судить об их способности к обобщению в географическом контексте.
FinRank: новый бенчмарк для проверки точности ответов в финансовой отчетности
Исследователи представили FinRank — специализированный бенчмарк для оценки систем RAG и вопросно-ответных моделей, работающих с документами SEC. В отличие от стандартных тестов, FinRank фокусируется не только на правильности итогового ответа, но и на корректности источника данных, что критически важно при анализе повторяющейся финансовой отчетности, где разные разделы могут содержать схожие, но контекстуально различные показатели.
LitTraceQA: новый бенчмарк для проверки точности ИИ в научной литературе
Исследователи представили LitTraceQA — специализированный бенчмарк для оценки способности языковых моделей работать с научными текстами. Инструмент фокусируется на многоэтапной проверке фактов и поиске доказательств в статьях. LitTraceQA помогает выявлять галлюцинации и оценивать, насколько ответы ИИ-систем соответствуют реальным данным из первоисточников, что критически важно для RAG-решений в академической и исследовательской среде.
Новый бенчмарк BenchCAD для оценки ИИ в инженерном проектировании
Исследователи представили BenchCAD — специализированный набор тестов для оценки способностей LLM в области автоматизированного проектирования (CAD). В ходе тестирования новые модели продемонстрировали значительный прогресс, превзойдя показатели предыдущих лидеров, таких как Opus и Mythos 5, в задачах генерации и оптимизации инженерных чертежей и 3D-моделей, достигнув новых высот в точности исполнения сложных технических спецификаций.
Исследование SciCode-Verified: почему текущие бенчмарки занижают способности LLM в научном кодинге
Исследователи представили SciCode-Verified — обновленный набор данных для оценки навыков LLM в написании научного кода. Анализ показал, что существующие бенчмарки содержат значительное количество дефектов, которые приводят к ложноотрицательным результатам. Исправление этих ошибок демонстрирует, что современные модели справляются с научными задачами программирования гораздо эффективнее, чем считалось ранее, что требует пересмотра подходов к тестированию ИИ в специализированных областях.
Китайская модель Kimi K3 показала высокие результаты в тестах безопасности UK AISI
Китайская языковая модель Kimi K3 от компании Moonshot AI успешно прошла независимое тестирование в Институте безопасности ИИ Великобритании (UK AISI). Модель продемонстрировала высокие показатели в оценке рисков, связанных с кибербезопасностью и автономным выполнением задач, что стало значимым событием для международного сообщества разработчиков, стремящихся к стандартизации методов оценки безопасности передовых систем.
ARF: новый формат для воспроизводимой оценки ИИ-моделей
Представлен ARF (AI Record Format) — открытый стандарт для хранения результатов запусков ИИ-моделей. Формат позволяет фиксировать не только ответы моделей, но и все метаданные, конфигурации и контекст выполнения, обеспечивая полную воспроизводимость экспериментов. Это решение упрощает сравнение бенчмарков и анализ производительности агентов в различных средах, устраняя проблему разрозненных данных при тестировании.
Обновление методологии Artificial Analysis для оценки качества LLM
Платформа Artificial Analysis представила версию 4.1.1 своего индекса Intelligence Index, обновляя подходы к сравнительному анализу больших языковых моделей. Обновление затрагивает методики оценки качества ответов, скорости генерации и стоимости инференса, предоставляя стандартизированные метрики для объективного сопоставления ведущих проприетарных и открытых моделей на рынке, что критически важно для выбора архитектуры под конкретные бизнес-задачи.
Qwen2.5-Max возглавила рейтинг агентских способностей LLM
Модель Qwen2.5-Max заняла первую строчку в обновленном Agentic Index от Artificial Analysis, обойдя конкурентов в задачах на автономное выполнение сложных многошаговых процессов. Исследование оценивает способность моделей эффективно использовать инструменты, планировать действия и достигать целей в агентских сценариях, где требуется высокая точность следования инструкциям и надежность при работе с внешними API.
Сравнение локальных LLM в задачах извлечения структурированных данных
Исследование Rakuen Software сравнивает эффективность популярных локальных моделей при извлечении фактов из неструктурированного текста. В тесте участвовали модели Llama 3, Mistral, Phi-3 и Gemma, оцениваемые по точности парсинга данных в JSON. Результаты показывают, что выбор архитектуры и размера модели критически влияет на качество извлечения, при этом некоторые компактные модели демонстрируют результаты, сопоставимые с более тяжелыми аналогами.
Методология оценки эффективности ИИ-агентов в бизнес-процессах
Компания NativePort представила методологию количественной оценки работы ИИ-агентов, ориентированную на бизнес-метрики. Подход позволяет измерять реальную производительность систем автоматизации, переходя от абстрактных показателей качества генерации текста к конкретным результатам, таким как скорость обработки запросов, точность выполнения целевых действий и итоговая экономическая эффективность внедрения агентных решений в корпоративные рабочие процессы.
AV-AIVAT: новый метод ускорения оценки ИИ-агентов в 74 раза
Исследователи представили метод AV-AIVAT, позволяющий радикально сократить затраты на сравнительное тестирование ИИ-агентов в играх с неполной информацией. Благодаря использованию сертифицированной методики остановки тестов, алгоритм определяет победителя в 74 раза быстрее традиционных подходов, минимизируя расходы на инференс моделей и экспертное время без потери статистической достоверности результатов.
Исследование: почему видеомодели ошибаются в подсчете событий
Исследователи выявили критическую проблему в современных видео-языковых моделях (VLM): неспособность точно отслеживать частоту и последовательность событий. Модели часто попадают в «ловушку низких частот», полагаясь на статистические закономерности вместо реального анализа видеоряда. Новый метод оценки, использующий трассировку событий, позволяет выявлять эти ошибки, которые скрыты в стандартных бенчмарках из-за их сложности и отсутствия контроля над параметрами.
Новый метод оценки качества бенчмарков для разговорных ИИ-агентов
Исследователи представили фреймворк для оценки качества наборов данных, используемых для тестирования диалоговых агентов. Инструмент анализирует бенчмарки на предмет логической согласованности, сложности сценариев и полноты охвата политик поведения. Использование LLM-судей позволяет выявлять слабые места в существующих тестах, которые часто содержат упрощенные задачи или противоречивые условия, искажающие реальные показатели производительности ИИ-систем.
Оценка способностей LLM к анализу нормативной документации
Исследователи представили новый подход к оценке и повышению эффективности языковых моделей при работе с нормативно-технической документацией. В ходе работы был создан специализированный бенчмарк на основе национальных стандартов (GB/T), требующий от моделей строгого соблюдения правил терминологии, структуры и перекрестных ссылок. Результаты показывают, что стандартные методы дообучения позволяют значительно повысить точность соблюдения формальных требований в сложных юридических и технических текстах.
HarnessOpt-Bench: новый стандарт для оценки оптимизации агентных систем
Исследователи представили HarnessOpt-Bench — специализированный бенчмарк для оценки способности LLM к автоматической оптимизации «обвязки» (harness) агентных систем. В отличие от классических тестов, оценивающих только веса моделей, этот инструмент фокусируется на итеративном улучшении промптов, инструментов, логики управления и механизмов памяти, что критически важно для повышения эффективности автономных ИИ-агентов в реальных задачах.
Анализ предвзятости систем автоматической оценки устной речи
Исследователи представили метод анализа предвзятости систем автоматической оценки владения иностранным языком (L2) на базе трансформеров. С помощью векторов активации концептов (CAV) авторы выявили, как модели учитывают нерелевантные атрибуты спикеров, такие как родной язык (L1) или возраст. Работа подчеркивает необходимость проверки алгоритмов, используемых в высокорисковых сценариях тестирования, на предмет справедливости и объективности оценки.
Повышение реалистичности синтетических медицинских данных для ИИ-бенчмарков
Исследователи представили новый метод улучшения синтетических клинических бенчмарков, которые часто проходят автоматические проверки полезности, но остаются структурно нереалистичными. Авторы формулируют задачу пересмотра бенчмарков как проблему оптимизации с ограничениями, что позволяет создавать более качественные наборы данных для обучения и тестирования ИИ-агентов в здравоохранении, сохраняя при этом соответствие строгим требованиям к конфиденциальности и функциональной пригодности.
Критика современных бенчмарков для LLM: почему текущие тесты не отражают реальную безопасность
Исследователи проанализировали ограничения существующих бенчмарков для оценки больших языковых моделей. Текущие методы тестирования часто полагаются лишь на API-запросы и однократные промпты, игнорируя влияние внешних инструментов, таких как веб-поиск и работа с цитированием. Это приводит к искаженному представлению о надежности и безопасности моделей при их реальном развертывании в сложных агентных системах.