OpenAI провела глубокую переработку архитектуры голосового движка ChatGPT, обеспечив полноценный дуплексный режим общения. Теперь модель способна слушать пользователя одновременно с генерацией ответа, что значительно снижает задержки и делает диалог естественным. Обновление направлено на устранение пауз, характерных для классических систем «запрос-ответ», и улучшение качества распознавания прерываний в ходе беседы.

Техническая реализация потребовала перехода от последовательной обработки аудио к параллельной потоковой передаче данных. Ранее система работала по принципу ожидания завершения фразы пользователя, после чего следовала обработка и синтез речи. Новая архитектура позволяет модели динамически реагировать на входящий аудиопоток, анализируя интонации и контекст в реальном времени, что критически важно для имитации живого общения.

Это изменение является частью стратегии по превращению голосового интерфейса из вспомогательного инструмента в полноценного ассистента. Улучшенная синхронизация между модулями распознавания речи (ASR), логическим ядром модели и синтезатором (TTS) позволяет минимизировать «эффект рации», когда собеседники вынуждены ждать очереди для высказывания. Подобные архитектурные сдвиги задают новый стандарт для всех систем голосового ИИ-взаимодействия.

Ключевые факты

  • Внедрена поддержка полноценного дуплексного режима, позволяющего модели слушать и говорить одновременно.
  • Переработан стек обработки аудио для минимизации задержек при прерывании модели пользователем.
  • Новая архитектура обеспечивает более естественную динамику диалога за счет параллельной обработки потоков данных.
  • Обновление направлено на устранение необходимости ожидания завершения фразы перед началом генерации ответа.