Оценка и бенчмарки
GameEngineBench: новый стандарт для оценки кодинг-агентов в среде C++
Исследователи представили GameEngineBench — специализированный бенчмарк для тестирования кодинг-агентов в условиях реальных игровых движков на C++. В отличие от стандартных тестов на изолированных функциях, этот инструмент оценивает способность моделей работать со сложными системами рендеринга, физики и сетевого взаимодействия, что критически важно для разработки 3D-приложений в робототехнике, медицине и архитектуре.
CAGE-1: новый стандарт оценки корпоративных ИИ-агентов
Исследователи представили CAGE-1 — методологию оценки корпоративных ИИ-агентов, ориентированную на контроль, безопасность и управление. В отличие от классических тестов для LLM, CAGE-1 фокусируется на способности агентов выполнять многошаговые задачи, взаимодействовать с внешними системами и соблюдать корпоративные политики в реальных рабочих процессах, что критически важно для перехода от экспериментов к полноценной автоматизации бизнеса.
Новый фреймворк для оценки методов оценки взаимной информации
Исследователи представили комплексный фреймворк для оценки методов вычисления взаимной информации (MI), устраняющий пробелы в существующих бенчмарках. В отличие от традиционных подходов, ограниченных низкоразмерными данными, новая методология опирается на копула-теоретическую перспективу. Это позволяет тестировать алгоритмы на сложных, реалистичных распределениях, обеспечивая более точное понимание их эффективности в задачах машинного обучения и статистики.
Бенчмарки ИИ систематически занижают реальные возможности агентов
Исследование Института безопасности ИИ Великобритании показало, что стандартные методы оценки моделей существенно недооценивают способности ИИ-агентов. Ограничения по вычислительным ресурсам и количеству токенов в тестах не позволяют моделям раскрыть потенциал при решении сложных задач. Увеличение лимитов приводит к резкому росту эффективности, особенно у современных моделей, что требует пересмотра подходов к тестированию систем на границе возможностей.
Детерминированная альтернатива LLM-as-a-Judge для оценки агентных систем
Исследователи представили метод детерминированной оценки состояний ИИ-агентов, предлагая альтернативу подходу LLM-as-a-Judge. Новый подход позволяет оценивать качество выполнения задач агентами без привлечения дорогостоящих и вариативных языковых моделей, обеспечивая воспроизводимость результатов. Это решение критически важно для отладки сложных агентных пайплайнов, где требуется высокая точность метрик при минимальных затратах на инференс.
Анализ производительности моделей Claude при работе с кодовыми базами
Исследователи протестировали возможности моделей Claude в решении комплексных задач, проанализировав репозиторий LangChain. Эксперимент показал, как современные LLM справляются с навигацией по сложной структуре кода, выявлением зависимостей и генерацией технической документации. Результаты демонстрируют текущие пределы контекстного окна и способности моделей к глубокому пониманию архитектуры программных проектов при автоматизированном аудите.
Почему ИИ-агенты склонны игнорировать риски безопасности кода
Исследование показывает, что современные ИИ-агенты для написания кода систематически недооценивают угрозы безопасности, даже при наличии явных уязвимостей. В ходе экспериментов модели в большинстве случаев подтверждали безопасность предложенных решений, игнорируя потенциальные векторы атак. Это создает ложное чувство защищенности у разработчиков, использующих автоматизированные инструменты для генерации и рефакторинга кода в реальных проектах.
Оптимизация системных промптов для SQL-агентов с помощью DSPy
Саймон Уиллисон продемонстрировал практический подход к улучшению системных промптов для Datasette Agent, используя фреймворк DSPy для автоматизированной оценки и оптимизации. Вместо ручной настройки инструкций, автор применил программный метод, позволяющий итеративно тестировать качество генерации SQL-запросов и повышать точность ответов агента при работе с базами данных, что значительно сокращает время на отладку агентных систем.
LACUNA: новый бенчмарк для оценки точности «забывания» данных в LLM
Исследователи представили LACUNA — специализированный тестовый стенд для оценки точности удаления (unlearning) конфиденциальной информации из больших языковых моделей. В отличие от существующих метрик, фокусирующихся на общем качестве генерации, LACUNA оценивает способность моделей локализовать и удалять конкретные параметры, связанные с чувствительными данными, предотвращая их утечку без ущерба для общей производительности системы.
TestEvo-Bench: новый стандарт оценки ИИ в генерации и обновлении тестов
Исследователи представили TestEvo-Bench — динамический бенчмарк для оценки способности ИИ-моделей синхронно обновлять программный код и соответствующие ему тесты. В отличие от статических наборов данных, этот инструмент проверяет исполняемость тестов и их семантическую связь с реальными изменениями в кодовой базе, что позволяет точнее измерять качество генерации кода в условиях непрерывной разработки.
EvoPolicyGym: новый стандарт для оценки автономной эволюции ИИ-агентов
Исследователи представили EvoPolicyGym — специализированную среду для тестирования способности ИИ-агентов самостоятельно улучшать исполняемые политики через итеративную обратную связь. В отличие от стандартных тестов, фокусирующихся на финальном результате, этот фреймворк изолирует процесс модификации кода агентом, позволяя количественно оценивать прогресс в обучении и адаптации системы в контролируемых интерактивных условиях.
Сравнение LLM в задачах рефакторинга сложных графов LangGraph
Исследование анализирует эффективность 11 современных языковых моделей при рефакторинге «god node» — перегруженного узла в архитектуре LangGraph. Автор тестирует способность моделей декомпозировать сложную логику, сохраняя при этом целостность графа. Результаты показывают значительные различия в качестве кода и понимании агентных потоков между проприетарными и открытыми моделями при работе с высокоуровневыми абстракциями.
AnyGroundBench: новый стандарт оценки VLM в специализированных видеозадачах
Исследователи представили AnyGroundBench — специализированный бенчмарк для оценки моделей компьютерного зрения (VLM) в задачах пространственно-временного поиска объектов на видео (STVG). В отличие от существующих тестов, сфокусированных на повседневных сценах, этот инструмент проверяет способность моделей работать с редкими визуальными концептами и сложными сценариями, критически важными для узкоспециализированных индустриальных применений.
Проблемы использования LLM в качестве судей для мультиязычных задач
Исследователи проанализировали ограничения парадигмы LLM-as-a-Judge при работе с многоязычными данными и редкими языками. Хотя использование нейросетей для оценки качества генерации стало стандартом, их эффективность резко падает за пределами английского языка. Авторы работы предлагают рекомендации по адаптации таких систем, чтобы минимизировать предвзятость и повысить точность оценки в условиях нехватки данных для обучения моделей-судей.
Eticas AI Risk Taxonomy: стандартизация аудита ИИ-систем
Исследователи представили Eticas AI Risk Taxonomy — открытую инфраструктуру, предназначенную для практического аудита ИИ-систем. В отличие от существующих 74 классификаций, которые ограничиваются лишь перечислением угроз, новый фреймворк предлагает методологию перевода абстрактных рисков в измеримые операционные показатели, необходимые для проведения полноценных проверок безопасности и этичности технологий в высокорисковых отраслях.
Новый бенчмарк для оценки клинического мышления LLM
Исследователи представили специализированный набор данных для тестирования навыков клинического мышления у передовых языковых моделей. В отличие от стандартных тестов с выбором ответа, новый бенчмарк фокусируется на открытых сценариях, составленных практикующими врачами. Результаты показывают, что даже топовые модели демонстрируют низкую эффективность в сложных медицинских задачах, где точность ответов в «сложном» сегменте не превышает 32%.
Anthropic скорректировала график производительности Claude 3.5 Sonnet
Компания Anthropic обновила официальный график сравнения производительности модели Claude 3.5 Sonnet после того, как исходная визуализация вызвала вопросы у сообщества. Первоначальная версия диаграммы демонстрировала результаты, которые могли быть интерпретированы как невыгодные для модели в сравнении с конкурентами. Изменения коснулись способа отображения данных, что спровоцировало дискуссии о прозрачности бенчмарков в индустрии ИИ.
A2utoLPBench: автоматизированный бенчмарк для проверки ИИ-агентов в линейном программировании
Исследователи представили A2utoLPBench — динамический бенчмарк для оценки способностей ИИ-агентов решать задачи линейного программирования (LP), сформулированные на естественном языке. В отличие от статических наборов данных, которые подвержены утечкам в обучающие выборки моделей, этот инструмент использует метод обратной конструкции KKT для автоматической генерации уникальных задач, что обеспечивает объективность тестирования и масштабируемость сложности.
Обновление CursorBench 3.1 для оценки ИИ-кодинга
Команда Cursor представила обновленный бенчмарк CursorBench 3.1, предназначенный для оценки эффективности LLM в задачах написания и редактирования кода. Инструмент фокусируется на реальных сценариях разработки, измеряя способность моделей справляться с многофайловыми изменениями и сложными рефакторингами, что позволяет точнее прогнозировать качество работы ИИ-ассистентов в профессиональной среде программирования.
Senior SWE-bench: новый стандарт оценки ИИ-агентов на уровне Senior-разработчиков
Представлен Senior SWE-bench — открытый бенчмарк для оценки способностей ИИ-агентов решать сложные инженерные задачи, требующие уровня квалификации Senior-разработчика. В отличие от базовых тестов, этот инструмент фокусируется на многоэтапном проектировании, глубоком анализе кодовой базы и исправлении архитектурных ошибок, имитируя реальный рабочий процесс в крупных репозиториях с открытым исходным кодом.
Reap: автоматизированный подход к созданию бенчмарков для кодинг-агентов
Исследователи представили Reap — фреймворк для автоматизированного формирования наборов данных, предназначенных для оценки возможностей ИИ-агентов в написании кода. Система решает проблему устаревания статических бенчмарков, динамически извлекая актуальные задачи из репозиториев с открытым исходным кодом. Это позволяет более точно измерять способность моделей решать реальные инженерные задачи, а не просто заучивать ответы из обучающей выборки.
Theoria: новый метод верификации логических рассуждений ИИ
Исследователи представили Theoria — архитектуру для верификации ответов ИИ, которая устраняет разрыв между строгими формальными доказательствами и субъективными оценками LLM-судей. Система преобразует предложенное решение в неформальные логические состояния и проверяет их на согласованность, обеспечивая прозрачный и аудируемый процесс подтверждения правильности выводов модели, что критически важно для задач, требующих высокой точности рассуждений.
Насколько надежны бенчмарки для оценки производительности кодинг-агентов
Исследователи поставили под сомнение точность современных бенчмарков для кодинг-агентов, таких как GSO, SWE-Perf и SWE-fficiency. Анализ показал, что текущие метрики часто смешивают реальные улучшения производительности кода с нестабильностью среды выполнения и специфическими особенностями самих тестов. Это ставит под вопрос объективность лидербордов, используемых для оценки прогресса в области автоматизированной разработки ПО.
Новый бенчмарк Adversarial Pragmatics для оценки безопасности LLM
Исследователи представили бенчмарк Adversarial Pragmatics, предназначенный для глубокого анализа безопасности языковых моделей. В отличие от традиционных тестов, которые сводят результаты к бинарным оценкам «прошел/не прошел», этот инструмент фокусируется на сложных лингвистических сценариях: конфликтах инструкций, скрытых командах и двусмысленности политик безопасности. Это позволяет точнее выявлять причины сбоев в поведении моделей при выполнении агентных задач.