Оценка и бенчмарки
Опыт Airbnb: как внедрить разработку на основе оценки (Eval-driven development)
Команда инженеров Airbnb поделилась опытом масштабирования генеративных ИИ-систем через методологию Eval-driven development. Основной фокус сделан на создании надежных пайплайнов оценки, которые позволяют объективно измерять качество ответов моделей в продакшене. Такой подход помогает минимизировать галлюцинации и гарантировать стабильность работы агентных систем при изменении промптов или обновлении базовых LLM.
OpenAI опубликовала детальный разбор логических рассуждений моделей o1
OpenAI представила технический документ, подробно описывающий процесс пошагового рассуждения моделей серии o1 при решении десяти сложных задач. В материале наглядно показано, как модель строит цепочку мыслей (Chain of Thought), анализирует промежуточные результаты и корректирует стратегию поиска решения, что позволяет достигать высокой точности в математических и логических дисциплинах.
Методология оценки мультимодальных моделей с помощью PerceptionBench
Представлен комплексный рабочий процесс для тестирования мультимодальных моделей зрения с использованием бенчмарка PerceptionBench. Система автоматизирует оценку способностей ИИ к распознаванию текста, подсчету объектов, локализации и выявлению галлюцинаций. Методология включает настройку среды, загрузку данных и использование автоматизированного судейства для получения объективных метрик производительности моделей в различных визуальных задачах.
OpenRouter представил Ori Eval для подбора оптимальной модели под конкретные задачи
OpenRouter запустил инструмент Ori Eval, который помогает разработчикам выбирать наиболее подходящую языковую модель для конкретных сценариев использования. Вместо опоры на общие лидерборды, сервис позволяет тестировать модели на собственных наборах данных, оценивая качество ответов, скорость генерации и стоимость запросов. Это дает возможность объективно определить, какая LLM лучше справляется с конкретной бизнес-задачей при заданном бюджете.
Создатели DesignArena привлекли $7,9 млн для улучшения вкусовых предпочтений ИИ-моделей
Платформа DesignArena, специализирующаяся на сборе человеческих оценок для обучения нейросетей, привлекла $7,9 млн инвестиций. Сервис позволяет разработчикам фронтирных моделей получать качественную обратную связь от пользователей, что критически важно для настройки «вкуса» и эстетических предпочтений ИИ. На текущий момент аудитория проекта достигла 5,3 миллиона человек по всему миру, обеспечивая масштабный поток данных для RLHF.
OnePot-Bench: новый стандарт оценки LLM в химических лабораторных исследованиях
Исследователи представили OnePot-Bench — специализированный бенчмарк для оценки способностей языковых моделей в области планирования и проведения химических экспериментов. В отличие от общих тестов, этот инструмент учитывает специфику лабораторной работы, требующую сочетания навыков решения задач и глубокой предметной интуиции, что критически важно для автоматизации научных исследований и ускорения разработки новых соединений.
Проблема оценки демографической репрезентативности в генеративных моделях
Исследователи представили методологию оценки справедливости генеративных моделей, фокусируясь на том, как именно ИИ распределяет демографические признаки в открытых запросах. Авторы критикуют текущие подходы, которые полагаются на заданные входные атрибуты, и предлагают новые критерии для обоснования того, какие именно демографические пропорции должны считаться эталонными при аудите результатов работы нейросетей.
MedPRESS: новый бенчмарк для проверки склонности LLM к поддакиванию пациентам
Исследователи представили MedPRESS — специализированный бенчмарк для оценки склонности больших языковых моделей к «сикофантии» (поддакиванию) в медицинских диалогах. В отличие от статических тестов, MedPRESS моделирует многоходовые беседы, где пациент оказывает давление на ИИ, пытаясь добиться желаемого, но неверного диагноза или лечения. Инструмент помогает выявить, насколько модели способны сохранять объективность под эмоциональным воздействием пользователя.
SWE-Touch: новый бенчмарк для оценки ИИ-агентов в условиях совместной работы с кодом
Исследователи представили SWE-Touch — первый бенчмарк для оценки ИИ-агентов, работающих в общих репозиториях вместе с человеком. В отличие от существующих тестов, где агент действует изолированно, SWE-Touch моделирует реальные сценарии разработки, требующие от модели адаптации к изменениям кода, внесенным пользователем в процессе выполнения задачи, что критически важно для оценки автономных инструментов программирования.
Новый метод Aggregate-then-Calibrate для объективной оценки ИИ-моделей
Исследователи представили метод Aggregate-then-Calibrate, решающий проблему субъективности при оценке ИИ-моделей человеком. Алгоритм объединяет разрозненные экспертные оценки с предсказаниями моделей, устраняя влияние неоднородной квалификации судей и различий в их шкалах. Это позволяет получать статистически обоснованные результаты в задачах, где отсутствует объективный эталон (ground truth), повышая надежность бенчмарков и систем принятия решений.
Выпущен инструмент с открытым кодом для оценки ИИ-агентов
Разработчики представили новый инструмент с открытым исходным кодом, предназначенный для оценки производительности ИИ-агентов. Решение позволяет автоматизировать процесс тестирования агентных систем, предоставляя метрики для анализа точности выполнения задач и принятия решений. Это упрощает отладку сложных цепочек действий и помогает разработчикам быстрее выявлять слабые места в логике работы автономных моделей в реальных сценариях.
Влияние навыков кодинга на расход токенов: результаты бенчмарка
Исследование оценивает эффективность использования специфических навыков кодинга при работе с LLM, анализируя, как различные подходы к формированию промптов влияют на потребление токенов. На основе серии из шести запусков задач авторы замерили корреляцию между структурой запроса и итоговым расходом ресурсов, предоставив данные для оптимизации затрат при разработке программного обеспечения с помощью ИИ.
Replaybook: фреймворк для оценки и тестирования ИИ-агентов
Replaybook — это новый инфраструктурный фреймворк, предназначенный для систематической оценки производительности ИИ-агентов. Инструмент позволяет разработчикам записывать и воспроизводить взаимодействия с агентами, создавая воспроизводимые сценарии тестирования. Это помогает отслеживать деградацию качества ответов при внесении изменений в промпты или архитектуру системы, обеспечивая надежность агентных рабочих процессов в продакшене.
DFAH-Bench: новый бенчмарк для оценки стабильности ИИ-агентов
IBM представила DFAH-Bench — специализированный бенчмарк для оценки надежности ИИ-агентов при выполнении идентичных задач с использованием различных цепочек инструментов. Инструмент позволяет выявить «дрейф результатов» (output drift), когда модель приходит к верному итогу, но делает это через разные последовательности вызовов API, что критически важно для предсказуемости бизнес-процессов и отладки агентных систем.
Maverik: инструмент для тестирования, сравнения и оценки стоимости MCP-агентов
Maverik — это специализированный инструмент для разработчиков, позволяющий проводить бенчмаркинг, сравнительный анализ и прогнозирование затрат для агентов, использующих протокол MCP (Model Context Protocol). Решение помогает оценивать эффективность работы агентных систем, анализировать их поведение в различных сценариях и контролировать расходы на инференс, что критически важно для масштабируемых ИИ-проектов.
Исследование рисков избыточного тестирования в LLM
Исследователи проанализировали проблему чрезмерного покрытия тестами при верификации больших языковых моделей. Выяснилось, что стремление к полному охвату сценариев часто приводит к снижению валидности результатов, так как модели начинают подстраиваться под специфику тестовых наборов, теряя способность к обобщению. Это создает ложное ощущение надежности систем, которые на практике оказываются менее устойчивыми к реальным задачам.
Использование MUD для оценки ИИ и искажения в суждениях LLM
Исследователи предложили использовать многопользовательские текстовые миры (MUD) как среду для оценки возможностей LLM. Традиционные метрики, такие как коэффициент каппа (κ), часто не учитывают специфические искажения, возникающие при использовании моделей в качестве «судей». Новый подход позволяет выявить системные ошибки в оценках, которые скрываются за усредненными показателями согласия между моделями.
RealReplicaBench: новый стандарт для оценки долгосрочных ИИ-агентов
Исследователи представили RealReplicaBench — фреймворк для тестирования ИИ-агентов в условиях, максимально приближенных к реальным веб-сервисам. В отличие от простых текстовых задач, система использует воспроизводимые и высокоточные копии онлайн-платформ, позволяя оценивать способность агентов выполнять сложные многошаговые действия с учетом состояния системы и долгосрочного планирования в динамической среде.
RealReplicaBench: новый стандарт для оценки долгосрочных ИИ-агентов
RealReplicaBench представляет собой платформу для тестирования ИИ-агентов в условиях, максимально приближенных к реальным веб-сервисам. В отличие от синтетических задач, этот бенчмарк использует высокоточные, воспроизводимые копии существующих онлайн-платформ. Инструмент позволяет оценивать способность агентов выполнять сложные многошаговые сценарии, требующие сохранения состояния системы и взаимодействия с динамическим интерфейсом в течение длительного времени.
RealReplicaBench: новый стандарт для оценки долгосрочных ИИ-агентов
RealReplicaBench — это новый фреймворк для тестирования ИИ-агентов в условиях, максимально приближенных к реальным веб-сервисам. В отличие от статических тестов, система создает высокоточные, воспроизводимые и стейтфул-копии онлайн-платформ. Это позволяет оценивать способность агентов выполнять сложные многошаговые задачи, требующие взаимодействия с динамическим интерфейсом и сохранения контекста на протяжении длительного времени.
DeBERTa-Sentinel: новый подход к детекции ИИ-сгенерированного текста
Исследователи представили DeBERTa-Sentinel — модель для обнаружения контента, созданного нейросетями. В отличие от предшественников, система лучше справляется с обобщением данных и противостоит методам перефразирования, которые часто обходят стандартные детекторы. Разработка направлена на повышение прозрачности веб-среды и борьбу с рисками, связанными с автоматизированной генерацией текста, такими как академическая нечестность и распространение дезинформации.
Новый подход к оценке ИИ-агентов в динамических корпоративных средах
Исследователи представили методологию для оценки ИИ-агентов, работающих в постоянно меняющихся корпоративных системах. В отличие от стандартных тестов, использующих статические снимки данных, новый подход позволяет воспроизводить временные сценарии. Это дает возможность проверять корректность ответов агента в зависимости от того, какая информация была доступна пользователю в конкретный момент времени в прошлом.
CallScreenBench: новый стандарт для оценки ИИ-секретарей на устройствах
Исследователи представили CallScreenBench — специализированный бенчмарк для оценки работы языковых моделей, выполняющих роль телефонных секретарей непосредственно на смартфонах. В отличие от стандартных агентных задач, этот сценарий требует обработки непредсказуемых входящих вызовов от сторонних собеседников, что ставит перед компактными квантованными моделями уникальные вызовы в области понимания контекста, соблюдения приватности и оперативного реагирования в реальном времени.
Новый бенчмарк для оценки галлюцинаций в мультимодальных моделях
Исследователи представили новый набор данных из 1600 примеров, написанных людьми, для оценки галлюцинаций в Vision-and-Language моделях. В отличие от существующих методов, полагающихся на генерацию ошибок самими нейросетями, этот подход позволяет создать независимый и долговечный стандарт тестирования, который не устаревает при выходе новых версий моделей и охватывает четыре мировых языка.