Компания PolyAI выпустила Dialog-RSN-1 — специализированную модель, которая обрабатывает аудиосигнал напрямую, минуя транскрипцию ASR. Решение объединяет функции распознавания речи, управления очередностью реплик и вызова внешних инструментов в едином контуре. Модель работает по запросному принципу, обеспечивая низкую задержку отклика, что критически важно для создания отзывчивых голосовых ИИ-агентов в клиентском сервисе.

В отличие от традиционных систем, которые сначала переводят голос в текст, а затем передают его в LLM, Dialog-RSN-1 анализирует звуковые характеристики напрямую. Это позволяет модели лучше улавливать интонации, паузы и контекст живого общения. При этом генерация речи (TTS) вынесена в отдельный модуль, что дает разработчикам возможность сохранять полный контроль над характеристиками голоса и его эмоциональной окраской.

Архитектура модели оптимизирована для интеграции в бизнес-процессы через механизм вызова функций (function calling). Это позволяет ИИ-агенту не просто поддерживать диалог, но и совершать действия в корпоративных системах в реальном времени. Использование запросной модели вместо потоковой обработки снижает вычислительную нагрузку, сохраняя при этом высокую скорость реакции, необходимую для бесшовного взаимодействия с пользователем.

Ключевые факты

  • Модель обрабатывает аудио напрямую, исключая промежуточный этап транскрипции (ASR).
  • Время отклика системы составляет менее 300 мс, что обеспечивает естественность диалога.
  • Архитектура поддерживает нативный вызов функций для выполнения бизнес-задач в ходе разговора.
  • Система работает как запрос-ответная модель, а не как постоянно активный поток, что повышает эффективность ресурсов.
  • Модуль синтеза речи (TTS) отделен от основной модели для гибкого управления тембром и стилем голоса.