Исследователи представили CallScreenBench — специализированный бенчмарк для оценки работы языковых моделей, выполняющих роль телефонных секретарей непосредственно на смартфонах. В отличие от стандартных агентных задач, этот сценарий требует обработки непредсказуемых входящих вызовов от сторонних собеседников, что ставит перед компактными квантованными моделями уникальные вызовы в области понимания контекста, соблюдения приватности и оперативного реагирования в реальном времени.

Развитие локальных моделей, способных работать на мобильном железе, делает автоматизацию обработки звонков практически реализуемой. Основная сложность заключается в том, что ИИ-секретарь сталкивается с неструктурированным общением, где собеседник не всегда настроен на сотрудничество или следование заданным алгоритмам. Бенчмарк фокусируется на способности модели адекватно классифицировать намерения звонящего, фильтровать спам и корректно передавать информацию владельцу устройства без отправки данных в облако.

Ключевые факты

  • CallScreenBench оценивает способность моделей выступать в роли автономных телефонных секретарей на мобильных устройствах.
  • Основной акцент сделан на работе с квантованными моделями малого размера, пригодными для инференса на смартфонах.
  • Тестирование учитывает специфику непредсказуемых входящих вызовов, где собеседник не является заранее подготовленным пользователем.
  • Методология направлена на проверку навыков фильтрации спама и извлечения значимой информации из диалога в условиях ограниченных вычислительных ресурсов.