Оценка и бенчмарки
Новый пайплайн для формирования регрессионных наборов данных в агентных платформах
Исследователи представили методологию формирования регрессионных наборов данных для платформ, поддерживающих расширяемость ИИ-агентов. Решение направлено на преодоление «парадокса регрессионной экономики», при котором платформы ограничены лимитами на количество запросов при тестировании, в то время как каждый клиент требует специфических проверок для своих доменных задач. Предложенный подход позволяет оптимизировать выборку тестов без потери качества контроля.
Исследование: почему LLM не справляются с ролью составителей тестов
Исследователи проанализировали способность языковых моделей выступать в роли экзаменаторов, создающих тестовые наборы и критерии оценки для других систем. Выяснилось, что при использовании стандартного подхода «one-shot» без цепочки рассуждений модели склонны к «молчаливым пропускам» — игнорированию допустимых вариантов ответов, что делает их оценки предвзятыми и неполными.
SCHEDBench: новый бенчмарк для проверки точности LLM в задачах планирования
Исследователи представили SCHEDBench — специализированный бенчмарк для оценки способности больших языковых моделей соблюдать строгие логические ограничения в комбинаторных задачах планирования. Инструмент проверяет, насколько точно модели придерживаются заданных условий при изменении формулировок запросов, сравнивая результаты генерации с эталонными решениями, полученными с помощью классических алгоритмических солверов.
Supabase представила инструмент для оценки качества ИИ-агентов
Компания Supabase выпустила Supabase Evals — специализированный фреймворк для тестирования и оценки производительности ИИ-агентов, взаимодействующих с базами данных. Инструмент позволяет разработчикам количественно измерять точность генерации SQL-запросов, корректность работы с векторным поиском и общую надежность агентных систем, использующих инфраструктуру Supabase, что помогает минимизировать галлюцинации и ошибки в реальных бизнес-сценариях.
Критический анализ математических способностей современных LLM
Исследователи провели независимую проверку математических навыков передовых языковых моделей, выявив значительные расхождения между заявленными результатами и реальной производительностью. Анализ показал, что многие модели демонстрируют признаки «заучивания» тестовых наборов данных, что приводит к завышению метрик точности при решении сложных задач, требующих глубокого логического вывода, а не простого воспроизведения паттернов из обучающей выборки.
IssueTrojanBench: новый бенчмарк для проверки безопасности ИИ-агентов в разработке
Исследователи представили IssueTrojanBench — специализированный бенчмарк для оценки устойчивости ИИ-агентов, пишущих код, к вредоносным запросам в системе отслеживания задач (issue trackers). Инструмент проверяет, насколько легко агенты поддаются манипуляциям, внедряя уязвимости или вредоносный код в репозитории при выполнении задач, полученных из скомпрометированных тикетов, что критически важно для безопасности автоматизированных пайплайнов разработки.
JetBrains представила бенчмарк для оценки ИИ-агентов в Kotlin
Компания JetBrains выпустила специализированный бенчмарк для тестирования возможностей ИИ-агентов при работе с кодом на языке Kotlin. Набор задач включает реальные сценарии разработки, требующие понимания сложной архитектуры проектов, работы с библиотеками и исправления ошибок. Инструмент позволяет объективно измерять эффективность моделей в задачах автоматизации программирования, предоставляя разработчикам стандартизированную метрику для сравнения различных решений.
Supabase представила open-source бенчмарк для оценки ИИ-агентов в задачах разработки
Компания Supabase выпустила инструмент Evals — открытый фреймворк для тестирования возможностей ИИ-агентов при работе с реальными задачами бэкенд-разработки. Система позволяет оценивать качество кода, создаваемого моделями вроде Claude Code, Codex и OpenCode, в изолированных контейнеризированных средах. Бенчмарк проверяет корректность выполнения специфических операций, таких как проектирование схем баз данных, отладка функций и настройка политик безопасности.
Модель оценки видимости ИИ: пять факторов доказательности
Исследователи представили модель AI Visibility Evidence, систематизирующую подходы к оценке надежности ИИ-систем. Методология выделяет пять ключевых факторов, ранжированных по уровню доказательности, что позволяет компаниям объективно измерять прозрачность и обоснованность работы своих моделей. Система помогает стандартизировать отчетность и снизить риски, связанные с «черными ящиками» в корпоративных ИИ-решениях.
Supabase представила платформу для оценки ИИ-агентов
Supabase запустила инструмент для оценки качества работы ИИ-агентов, интегрированный непосредственно в инфраструктуру базы данных. Решение позволяет разработчикам проводить A/B-тестирование промптов, отслеживать метрики точности и анализировать логи взаимодействий в режиме реального времени. Это упрощает процесс итерации над агентными системами, обеспечивая прозрачный контроль над качеством ответов и эффективностью использования токенов в рамках единой экосистемы.
Kimi K3 превзошла GPT-4o в решении инженерных задач
Китайская модель Kimi K3 от компании Moonshot AI показала превосходство над GPT-4o в специализированном бенчмарке First Tree, ориентированном на сложные инженерные задачи. Тестирование проводилось с использованием методологии Sol, которая оценивает способность моделей к автономному решению многошаговых технических проблем, требующих глубокой логики и точности в программировании и системном проектировании.
DeepSeek V4 Flash показала эффективность, сопоставимую с GPT-5.6 в Agentic Memory Benchmark
Новый бенчмарк Agentic Memory Benchmark (ATM) продемонстрировал, что модель DeepSeek V4 Flash стоимостью $0,26 за прогон достигает результатов, сопоставимых с GPT-5.6, чей запуск обходится в $5,01. Это подчеркивает значительный разрыв в экономической эффективности современных LLM при выполнении задач, требующих работы с агентной памятью и долгосрочным контекстом.
Smevals: новый инструмент для оценки LLM и промптов
Саймон Уиллисон представил smevals — легковесный фреймворк для запуска наборов тестов (evals) и оценки ответов языковых моделей. Инструмент позволяет систематически проверять эффективность различных конфигураций моделей и промптов, автоматизируя процесс грейдинга результатов. Разработка велась совместно с исследовательской лабораторией Prime Radiant для решения задач по анализу реальных способностей ИИ-систем в прикладных сценариях.
Представлен VAmoS Bench: новый стандарт для оценки голосовых ИИ-агентов
Исследователи представили VAmoS Bench — специализированный бенчмарк для оценки производительности голосовых ИИ-агентов в реальных сценариях взаимодействия. Инструмент фокусируется на критических аспектах работы систем: задержке отклика, точности распознавания речи, качестве синтеза голоса и способности агента поддерживать контекст диалога в условиях естественного общения, что позволяет объективно сравнивать современные разговорные модели.
Масштабный бенчмарк SWE-bench для оценки ИИ-агентов в разработке ПО
Проект SWE-rebench представил комплексное сравнение 13 языковых моделей и 4 агентских систем при решении задач по исправлению реальных программных ошибок. Исследование охватывает пять популярных языков программирования: Go, Java, Python, Rust и TypeScript. Бенчмарк позволяет оценить способность ИИ-агентов ориентироваться в сложных кодовых базах и выполнять автономные правки в репозиториях.
ExtractBench: новый стандарт для оценки извлечения данных из документов
Исследователи представили ExtractBench — специализированный бенчмарк для оценки качества работы ИИ-агентов при извлечении структурированных данных из корпоративных документов. Инструмент фокусируется на точности значений и полноте записей в соответствии с заданными схемами, обеспечивая проверку способности моделей подтверждать извлеченную информацию ссылками на исходные фрагменты текста, что критически важно для автоматизации бизнес-процессов.
Анализ 212 тысяч задач показал преимущество контекста над общими промптами в кодинге
Масштабное исследование 212 000 задач по написанию кода подтвердило, что качество ответов ИИ-моделей напрямую зависит от объема и точности предоставленного контекста. Общие инструкции значительно уступают детализированным запросам, содержащим специфические требования к архитектуре и окружению. Результаты подчеркивают необходимость перехода от простых промптов к структурированной передаче данных при работе с LLM в разработке.
AgentHPOBench: новый бенчмарк для оценки ИИ-агентов в задачах оптимизации гиперпараметров
Исследователи представили AgentHPOBench — специализированный бенчмарк для оценки способности LLM-агентов выступать в роли автономных оптимизаторов гиперпараметров. В отличие от существующих тестов, сфокусированных на генерации кода или проверке ответов, этот инструмент анализирует, насколько эффективно агент интерпретирует экспериментальные данные и использует их для итеративного улучшения параметров моделей в последовательном процессе.
Новая метрика EPC для оценки интерпретируемости ИИ-моделей
Исследователи представили EPC (Explainability-Performance Coefficient) — новую метрику для оценки качества объяснений в глубоком обучении. Инструмент позволяет объективно измерять соответствие между логикой работы модели и человеческим восприятием. Это решает проблему разрыва между математической точностью алгоритмов и их интерпретируемостью, что критически важно для внедрения ИИ в медицине, финансах и других высокорискованных отраслях.
FriendBench: новый бенчмарк для оценки социального интеллекта мультимодальных моделей
Исследователи представили FriendBench — специализированный бенчмарк для проверки способности ИИ-моделей определять степень знакомства между людьми на основе анализа их поведения. Тестирование проводится на 20-секундных видеофрагментах диалогов, где содержание речи идентично для всех пар, что вынуждает модели опираться исключительно на невербальные сигналы, интонации и динамику взаимодействия для оценки социального контекста.
DungeonBench: новый бенчмарк для оценки тактического мышления ИИ в D&D
Исследователи представили DungeonBench — специализированный бенчмарк для проверки способностей LLM к сложному тактическому планированию в условиях настольной ролевой игры Dungeons & Dragons. В отличие от стандартных тестов, этот набор данных фокусируется на одновременном учете геометрии поля боя, управления ресурсами, таймингов и многоуровневых правил, что критически важно для оценки логического мышления моделей.
ARB: новый бенчмарк для проверки детекторов ИИ-текста
Исследователи представили ARB (Authorship-Rewriting Benchmark) — новый набор данных для оценки эффективности детекторов ИИ-контента. В отличие от стандартных тестов, сравнивающих чистый человеческий текст с генерацией LLM, ARB фокусируется на случаях, когда ИИ перефразирует или переписывает авторский текст человека. Это позволяет точнее оценить устойчивость детекторов к методам обхода защиты через рерайтинг.
Исследование: ИИ-агенты для программирования игнорируют правила участия в open-source
Новое исследование показало, что современные ИИ-агенты, предназначенные для написания кода, крайне редко обращаются к документации и правилам участия в open-source проектах. В ходе тестов модели в 85% случаев игнорировали файлы CONTRIBUTING.md, что приводило к созданию патчей, не соответствующих стандартам сообществ и требованиям лицензирования, несмотря на наличие инструментов для поиска информации.
Deep-20: новый бенчмарк для LLM на основе игры «20 вопросов»
Исследователи представили Deep-20 — новый метод оценки языковых моделей, основанный на классической игре «20 вопросов». В отличие от статических тестов, этот подход проверяет способность ИИ к стратегическому планированию, задаванию уточняющих вопросов и эффективному сбору информации в условиях неопределенности. Бенчмарк позволяет оценить логику моделей в динамических диалогах, где успех зависит от качества каждого последующего запроса.