Оценка и бенчмарки
LoSoNA: новый бенчмарк для адаптации ИИ-агентов к социальным нормам в чатах
Исследователи представили LoSoNA — первый бенчмарк, оценивающий способность ИИ-агентов адаптироваться к неявным социальным нормам в групповых чатах. В отличие от традиционных тестов на понимание контекста, LoSoNA фокусируется на динамических социальных правилах, которые формируются в онлайн-диалогах. Например, в одном сценарии агент должен понять, что в группе принято избегать обсуждения политики, а в другом — адаптироваться к шуткам и иронии.
Olmo-Eval: инструмент для оценки моделей в цикле разработки
AllenAI представила Olmo-Eval — инструмент для оценки моделей в процессе их разработки. Это решение позволяет автоматизировать и ускорить процесс тестирования моделей, что особенно важно для создания ИИ-агентов. Olmo-Eval интегрируется в существующие пайплайны разработки и предоставляет детальные метрики производительности моделей.
AgentBeats: новый подход к оценке ИИ-агентов
Исследователи из Arxiv предложили новый подход к оценке ИИ-агентов, который решает проблему фрагментированности тестирования. В статье "AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility" авторы отмечают, что существующие бенчмарки часто зависят от фиксированных, ориентированных на LLM, тестовых фреймворков. Это создает несоответствие между тестовыми и производственными условиями, а также ограничивает справедливое сравнение различных архитектур агентов.
Новые протоколы для оценки уверенности в многоагентных системах
Исследователи из MIT и Стэнфорда предложили новый подход к оценке уверенности в многоагентных системах. В работе, опубликованной на arXiv, они демонстрируют, как агрегировать сигналы уверенности от нескольких агентов для повышения надежности и прозрачности принятия решений.
OpenAI представила гайдлайн для проверки ИИ от третьих сторон
OpenAI выпустила руководство по проведению независимых оценок ИИ-систем. Документ охватывает ключевые аспекты: проверку возможностей моделей, их защищенность и достоверность результатов. Особое внимание уделено фронтирным системам, которые могут иметь значительное влияние на общество.
Как правильно оценивать ИИ-агентов
В статье на NVIDIA Developer разбирают ключевые различия между оценкой моделей и оценкой агентов. Авторы подчёркивают, что, хотя оба процесса связаны, они решают разные задачи. Оценка модели фокусируется на её способностях, тогда как оценка агента требует анализа его поведения в реальных сценариях.
VAKRA: новый бенчмарк для тестирования ИИ-агентов
Исследователи из IBM Research представили VAKRA — новый бенчмарк для оценки способностей ИИ-агентов к логическому мышлению, использованию инструментов и обработке ошибок. В отличие от существующих тестов, VAKRA фокусируется на комплексных сценариях, требующих от агентов не только генерации текста, но и выполнения последовательных действий с анализом промежуточных результатов.
Как определить достаточное количество экспертов для оценки ИИ
Google Research опубликовал исследование, посвящённое вопросу: сколько экспертов нужно для объективной оценки качества ИИ-моделей. В статье рассматриваются методы статистического анализа, которые позволяют определить минимальное количество рейтингов (оценок), необходимых для достижения надёжных результатов.
Salesforce представил Slackbot как полноценного ИИ-агента
Salesforce запустил переработанную версию Slackbot, превратив его из простого инструмента уведомлений в полноценного ИИ-агента. Новый Slackbot способен искать корпоративные данные, составлять документы и выполнять действия от имени сотрудников. Это значительный шаг в развитии корпоративных ИИ-агентов, демонстрирующий, как крупные компании интегрируют ИИ в рабочие процессы.