Оценка и бенчмарки

LoSoNA: новый бенчмарк для адаптации ИИ-агентов к социальным нормам в чатах arXiv · 12.06.2026 Исследователи представили LoSoNA — первый бенчмарк, оценивающий способность ИИ-агентов адаптироваться к неявным социальным нормам в групповых чатах. В отличие от традиционных тестов на понимание контекста, LoSoNA фокусируется на динамических социальных правилах, которые формируются в онлайн-диалогах. Например, в одном сценарии агент должен понять, что в группе принято избегать обсуждения политики, а в другом — адаптироваться к шуткам и иронии. Olmo-Eval: инструмент для оценки моделей в цикле разработки Hugging Face - Blog · 12.06.2026 AllenAI представила Olmo-Eval — инструмент для оценки моделей в процессе их разработки. Это решение позволяет автоматизировать и ускорить процесс тестирования моделей, что особенно важно для создания ИИ-агентов. Olmo-Eval интегрируется в существующие пайплайны разработки и предоставляет детальные метрики производительности моделей. AgentBeats: новый подход к оценке ИИ-агентов arXiv · 11.06.2026 Исследователи из Arxiv предложили новый подход к оценке ИИ-агентов, который решает проблему фрагментированности тестирования. В статье "AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility" авторы отмечают, что существующие бенчмарки часто зависят от фиксированных, ориентированных на LLM, тестовых фреймворков. Это создает несоответствие между тестовыми и производственными условиями, а также ограничивает справедливое сравнение различных архитектур агентов. Новые протоколы для оценки уверенности в многоагентных системах arXiv · 11.06.2026 Исследователи из MIT и Стэнфорда предложили новый подход к оценке уверенности в многоагентных системах. В работе, опубликованной на arXiv, они демонстрируют, как агрегировать сигналы уверенности от нескольких агентов для повышения надежности и прозрачности принятия решений. OpenAI представила гайдлайн для проверки ИИ от третьих сторон OpenAI News · 28.05.2026 OpenAI выпустила руководство по проведению независимых оценок ИИ-систем. Документ охватывает ключевые аспекты: проверку возможностей моделей, их защищенность и достоверность результатов. Особое внимание уделено фронтирным системам, которые могут иметь значительное влияние на общество. Как правильно оценивать ИИ-агентов NVIDIA Technical Blog · 19.05.2026 В статье на NVIDIA Developer разбирают ключевые различия между оценкой моделей и оценкой агентов. Авторы подчёркивают, что, хотя оба процесса связаны, они решают разные задачи. Оценка модели фокусируется на её способностях, тогда как оценка агента требует анализа его поведения в реальных сценариях. VAKRA: новый бенчмарк для тестирования ИИ-агентов Hugging Face - Blog · 15.04.2026 Исследователи из IBM Research представили VAKRA — новый бенчмарк для оценки способностей ИИ-агентов к логическому мышлению, использованию инструментов и обработке ошибок. В отличие от существующих тестов, VAKRA фокусируется на комплексных сценариях, требующих от агентов не только генерации текста, но и выполнения последовательных действий с анализом промежуточных результатов. Как определить достаточное количество экспертов для оценки ИИ The latest research from Google · 31.03.2026 Google Research опубликовал исследование, посвящённое вопросу: сколько экспертов нужно для объективной оценки качества ИИ-моделей. В статье рассматриваются методы статистического анализа, которые позволяют определить минимальное количество рейтингов (оценок), необходимых для достижения надёжных результатов. Salesforce представил Slackbot как полноценного ИИ-агента AI | VentureBeat · 13.01.2026 Salesforce запустил переработанную версию Slackbot, превратив его из простого инструмента уведомлений в полноценного ИИ-агента. Новый Slackbot способен искать корпоративные данные, составлять документы и выполнять действия от имени сотрудников. Это значительный шаг в развитии корпоративных ИИ-агентов, демонстрирующий, как крупные компании интегрируют ИИ в рабочие процессы.