Исследователи представили CallScreenBench — специализированный бенчмарк для оценки работы языковых моделей, выполняющих роль телефонных секретарей непосредственно на смартфонах. В отличие от стандартных агентных задач, этот сценарий требует обработки непредсказуемых входящих вызовов от сторонних собеседников, что ставит перед компактными квантованными моделями уникальные вызовы в области понимания контекста, соблюдения приватности и оперативного реагирования в реальном времени.
Развитие локальных моделей, способных работать на мобильном железе, делает автоматизацию обработки звонков практически реализуемой. Основная сложность заключается в том, что ИИ-секретарь сталкивается с неструктурированным общением, где собеседник не всегда настроен на сотрудничество или следование заданным алгоритмам. Бенчмарк фокусируется на способности модели адекватно классифицировать намерения звонящего, фильтровать спам и корректно передавать информацию владельцу устройства без отправки данных в облако.
Ключевые факты
- CallScreenBench оценивает способность моделей выступать в роли автономных телефонных секретарей на мобильных устройствах.
- Основной акцент сделан на работе с квантованными моделями малого размера, пригодными для инференса на смартфонах.
- Тестирование учитывает специфику непредсказуемых входящих вызовов, где собеседник не является заранее подготовленным пользователем.
- Методология направлена на проверку навыков фильтрации спама и извлечения значимой информации из диалога в условиях ограниченных вычислительных ресурсов.