Исследователи представили Deep-20 — новый метод оценки языковых моделей, основанный на классической игре «20 вопросов». В отличие от статических тестов, этот подход проверяет способность ИИ к стратегическому планированию, задаванию уточняющих вопросов и эффективному сбору информации в условиях неопределенности. Бенчмарк позволяет оценить логику моделей в динамических диалогах, где успех зависит от качества каждого последующего запроса.

Традиционные бенчмарки часто страдают от «загрязнения» данных, когда модели обучаются на тестовых вопросах. Использование игры «20 вопросов» минимизирует этот риск, так как пространство возможных стратегий и путей к правильному ответу практически бесконечно. Модель должна не просто извлекать факты из памяти, а выстраивать иерархию гипотез, отсекая неверные варианты на основе полученных ответов.

Методология Deep-20 включает в себя оценку как способности модели быть «отгадывающим» (игроком), так и «загадывающим» (ведущим). Это дает более глубокое понимание того, насколько эффективно модель управляет контекстом и как она адаптирует свои рассуждения в зависимости от ответов собеседника. Такой подход приближает тестирование LLM к реальным сценариям использования, где ИИ-агенты должны взаимодействовать с пользователями для уточнения их потребностей.

Ключевые факты

  • Deep-20 оценивает способность моделей к многоходовому планированию и сбору информации через диалог.
  • Бенчмарк минимизирует влияние «загрязнения» данных, характерного для статических тестов с фиксированными вопросами.
  • Тестирование включает две роли: модель-игрок, которая задает вопросы, и модель-ведущий, которая хранит секретный объект.
  • Метод позволяет измерить эффективность поиска информации и логическую последовательность рассуждений в динамической среде.
  • Проект опубликован с открытым исходным кодом для независимой проверки производительности различных LLM.