Оценка и бенчмарки

Новый пайплайн для формирования регрессионных наборов данных в агентных платформах arXiv · 02.08.2026 Исследователи представили методологию формирования регрессионных наборов данных для платформ, поддерживающих расширяемость ИИ-агентов. Решение направлено на преодоление «парадокса регрессионной экономики», при котором платформы ограничены лимитами на количество запросов при тестировании, в то время как каждый клиент требует специфических проверок для своих доменных задач. Предложенный подход позволяет оптимизировать выборку тестов без потери качества контроля. Исследование: почему LLM не справляются с ролью составителей тестов arXiv · 02.08.2026 Исследователи проанализировали способность языковых моделей выступать в роли экзаменаторов, создающих тестовые наборы и критерии оценки для других систем. Выяснилось, что при использовании стандартного подхода «one-shot» без цепочки рассуждений модели склонны к «молчаливым пропускам» — игнорированию допустимых вариантов ответов, что делает их оценки предвзятыми и неполными. SCHEDBench: новый бенчмарк для проверки точности LLM в задачах планирования arXiv · 02.08.2026 Исследователи представили SCHEDBench — специализированный бенчмарк для оценки способности больших языковых моделей соблюдать строгие логические ограничения в комбинаторных задачах планирования. Инструмент проверяет, насколько точно модели придерживаются заданных условий при изменении формулировок запросов, сравнивая результаты генерации с эталонными решениями, полученными с помощью классических алгоритмических солверов. Supabase представила инструмент для оценки качества ИИ-агентов Hacker News · 01.08.2026 Компания Supabase выпустила Supabase Evals — специализированный фреймворк для тестирования и оценки производительности ИИ-агентов, взаимодействующих с базами данных. Инструмент позволяет разработчикам количественно измерять точность генерации SQL-запросов, корректность работы с векторным поиском и общую надежность агентных систем, использующих инфраструктуру Supabase, что помогает минимизировать галлюцинации и ошибки в реальных бизнес-сценариях. Критический анализ математических способностей современных LLM Hacker News · 01.08.2026 Исследователи провели независимую проверку математических навыков передовых языковых моделей, выявив значительные расхождения между заявленными результатами и реальной производительностью. Анализ показал, что многие модели демонстрируют признаки «заучивания» тестовых наборов данных, что приводит к завышению метрик точности при решении сложных задач, требующих глубокого логического вывода, а не простого воспроизведения паттернов из обучающей выборки. IssueTrojanBench: новый бенчмарк для проверки безопасности ИИ-агентов в разработке Hacker News · 01.08.2026 Исследователи представили IssueTrojanBench — специализированный бенчмарк для оценки устойчивости ИИ-агентов, пишущих код, к вредоносным запросам в системе отслеживания задач (issue trackers). Инструмент проверяет, насколько легко агенты поддаются манипуляциям, внедряя уязвимости или вредоносный код в репозитории при выполнении задач, полученных из скомпрометированных тикетов, что критически важно для безопасности автоматизированных пайплайнов разработки. JetBrains представила бенчмарк для оценки ИИ-агентов в Kotlin Hacker News · 01.08.2026 Компания JetBrains выпустила специализированный бенчмарк для тестирования возможностей ИИ-агентов при работе с кодом на языке Kotlin. Набор задач включает реальные сценарии разработки, требующие понимания сложной архитектуры проектов, работы с библиотеками и исправления ошибок. Инструмент позволяет объективно измерять эффективность моделей в задачах автоматизации программирования, предоставляя разработчикам стандартизированную метрику для сравнения различных решений. Supabase представила open-source бенчмарк для оценки ИИ-агентов в задачах разработки MarkTechPost · 01.08.2026 Компания Supabase выпустила инструмент Evals — открытый фреймворк для тестирования возможностей ИИ-агентов при работе с реальными задачами бэкенд-разработки. Система позволяет оценивать качество кода, создаваемого моделями вроде Claude Code, Codex и OpenCode, в изолированных контейнеризированных средах. Бенчмарк проверяет корректность выполнения специфических операций, таких как проектирование схем баз данных, отладка функций и настройка политик безопасности. Модель оценки видимости ИИ: пять факторов доказательности Hacker News · 01.08.2026 Исследователи представили модель AI Visibility Evidence, систематизирующую подходы к оценке надежности ИИ-систем. Методология выделяет пять ключевых факторов, ранжированных по уровню доказательности, что позволяет компаниям объективно измерять прозрачность и обоснованность работы своих моделей. Система помогает стандартизировать отчетность и снизить риски, связанные с «черными ящиками» в корпоративных ИИ-решениях. Supabase представила платформу для оценки ИИ-агентов Hacker News · 31.07.2026 Supabase запустила инструмент для оценки качества работы ИИ-агентов, интегрированный непосредственно в инфраструктуру базы данных. Решение позволяет разработчикам проводить A/B-тестирование промптов, отслеживать метрики точности и анализировать логи взаимодействий в режиме реального времени. Это упрощает процесс итерации над агентными системами, обеспечивая прозрачный контроль над качеством ответов и эффективностью использования токенов в рамках единой экосистемы. Kimi K3 превзошла GPT-4o в решении инженерных задач Hacker News · 31.07.2026 Китайская модель Kimi K3 от компании Moonshot AI показала превосходство над GPT-4o в специализированном бенчмарке First Tree, ориентированном на сложные инженерные задачи. Тестирование проводилось с использованием методологии Sol, которая оценивает способность моделей к автономному решению многошаговых технических проблем, требующих глубокой логики и точности в программировании и системном проектировании. DeepSeek V4 Flash показала эффективность, сопоставимую с GPT-5.6 в Agentic Memory Benchmark Hacker News · 31.07.2026 Новый бенчмарк Agentic Memory Benchmark (ATM) продемонстрировал, что модель DeepSeek V4 Flash стоимостью $0,26 за прогон достигает результатов, сопоставимых с GPT-5.6, чей запуск обходится в $5,01. Это подчеркивает значительный разрыв в экономической эффективности современных LLM при выполнении задач, требующих работы с агентной памятью и долгосрочным контекстом. Smevals: новый инструмент для оценки LLM и промптов Simon Willison's Weblog · 31.07.2026 Саймон Уиллисон представил smevals — легковесный фреймворк для запуска наборов тестов (evals) и оценки ответов языковых моделей. Инструмент позволяет систематически проверять эффективность различных конфигураций моделей и промптов, автоматизируя процесс грейдинга результатов. Разработка велась совместно с исследовательской лабораторией Prime Radiant для решения задач по анализу реальных способностей ИИ-систем в прикладных сценариях. Представлен VAmoS Bench: новый стандарт для оценки голосовых ИИ-агентов Hacker News · 31.07.2026 Исследователи представили VAmoS Bench — специализированный бенчмарк для оценки производительности голосовых ИИ-агентов в реальных сценариях взаимодействия. Инструмент фокусируется на критических аспектах работы систем: задержке отклика, точности распознавания речи, качестве синтеза голоса и способности агента поддерживать контекст диалога в условиях естественного общения, что позволяет объективно сравнивать современные разговорные модели. Масштабный бенчмарк SWE-bench для оценки ИИ-агентов в разработке ПО Hacker News · 31.07.2026 Проект SWE-rebench представил комплексное сравнение 13 языковых моделей и 4 агентских систем при решении задач по исправлению реальных программных ошибок. Исследование охватывает пять популярных языков программирования: Go, Java, Python, Rust и TypeScript. Бенчмарк позволяет оценить способность ИИ-агентов ориентироваться в сложных кодовых базах и выполнять автономные правки в репозиториях. ExtractBench: новый стандарт для оценки извлечения данных из документов arXiv · 31.07.2026 Исследователи представили ExtractBench — специализированный бенчмарк для оценки качества работы ИИ-агентов при извлечении структурированных данных из корпоративных документов. Инструмент фокусируется на точности значений и полноте записей в соответствии с заданными схемами, обеспечивая проверку способности моделей подтверждать извлеченную информацию ссылками на исходные фрагменты текста, что критически важно для автоматизации бизнес-процессов. Анализ 212 тысяч задач показал преимущество контекста над общими промптами в кодинге Hacker News · 31.07.2026 Масштабное исследование 212 000 задач по написанию кода подтвердило, что качество ответов ИИ-моделей напрямую зависит от объема и точности предоставленного контекста. Общие инструкции значительно уступают детализированным запросам, содержащим специфические требования к архитектуре и окружению. Результаты подчеркивают необходимость перехода от простых промптов к структурированной передаче данных при работе с LLM в разработке. AgentHPOBench: новый бенчмарк для оценки ИИ-агентов в задачах оптимизации гиперпараметров arXiv · 31.07.2026 Исследователи представили AgentHPOBench — специализированный бенчмарк для оценки способности LLM-агентов выступать в роли автономных оптимизаторов гиперпараметров. В отличие от существующих тестов, сфокусированных на генерации кода или проверке ответов, этот инструмент анализирует, насколько эффективно агент интерпретирует экспериментальные данные и использует их для итеративного улучшения параметров моделей в последовательном процессе. Новая метрика EPC для оценки интерпретируемости ИИ-моделей arXiv · 31.07.2026 Исследователи представили EPC (Explainability-Performance Coefficient) — новую метрику для оценки качества объяснений в глубоком обучении. Инструмент позволяет объективно измерять соответствие между логикой работы модели и человеческим восприятием. Это решает проблему разрыва между математической точностью алгоритмов и их интерпретируемостью, что критически важно для внедрения ИИ в медицине, финансах и других высокорискованных отраслях. FriendBench: новый бенчмарк для оценки социального интеллекта мультимодальных моделей arXiv · 31.07.2026 Исследователи представили FriendBench — специализированный бенчмарк для проверки способности ИИ-моделей определять степень знакомства между людьми на основе анализа их поведения. Тестирование проводится на 20-секундных видеофрагментах диалогов, где содержание речи идентично для всех пар, что вынуждает модели опираться исключительно на невербальные сигналы, интонации и динамику взаимодействия для оценки социального контекста. DungeonBench: новый бенчмарк для оценки тактического мышления ИИ в D&D arXiv · 31.07.2026 Исследователи представили DungeonBench — специализированный бенчмарк для проверки способностей LLM к сложному тактическому планированию в условиях настольной ролевой игры Dungeons & Dragons. В отличие от стандартных тестов, этот набор данных фокусируется на одновременном учете геометрии поля боя, управления ресурсами, таймингов и многоуровневых правил, что критически важно для оценки логического мышления моделей. ARB: новый бенчмарк для проверки детекторов ИИ-текста arXiv · 31.07.2026 Исследователи представили ARB (Authorship-Rewriting Benchmark) — новый набор данных для оценки эффективности детекторов ИИ-контента. В отличие от стандартных тестов, сравнивающих чистый человеческий текст с генерацией LLM, ARB фокусируется на случаях, когда ИИ перефразирует или переписывает авторский текст человека. Это позволяет точнее оценить устойчивость детекторов к методам обхода защиты через рерайтинг. Исследование: ИИ-агенты для программирования игнорируют правила участия в open-source Hacker News · 31.07.2026 Новое исследование показало, что современные ИИ-агенты, предназначенные для написания кода, крайне редко обращаются к документации и правилам участия в open-source проектах. В ходе тестов модели в 85% случаев игнорировали файлы CONTRIBUTING.md, что приводило к созданию патчей, не соответствующих стандартам сообществ и требованиям лицензирования, несмотря на наличие инструментов для поиска информации. Deep-20: новый бенчмарк для LLM на основе игры «20 вопросов» Hacker News · 31.07.2026 Исследователи представили Deep-20 — новый метод оценки языковых моделей, основанный на классической игре «20 вопросов». В отличие от статических тестов, этот подход проверяет способность ИИ к стратегическому планированию, задаванию уточняющих вопросов и эффективному сбору информации в условиях неопределенности. Бенчмарк позволяет оценить логику моделей в динамических диалогах, где успех зависит от качества каждого последующего запроса.