OpenAI разработала систему GPT-Live, обеспечивающую непрерывное голосовое общение с ИИ без пауз и задержек. Инженеры создали архитектуру, которая обрабатывает речь в режиме потока, исключая необходимость в классических циклах «запрос-ответ». Это позволяет модели реагировать на прерывания и поддерживать естественный темп диалога, что критически важно для создания отзывчивых голосовых агентов нового поколения.
Ключевым вызовом при создании системы стала минимизация задержек (latency) при передаче аудиоданных. Традиционные методы, основанные на транскрибации речи в текст и последующей генерации ответа, вносили существенные временные лаги, разрушающие эффект живого общения. Новая архитектура использует специализированные модели, работающие напрямую с аудиопотоком, что позволяет системе «слышать» пользователя и генерировать реакцию практически мгновенно.
Разработка системы заняла шесть месяцев интенсивной работы над оптимизацией инференса и сетевых протоколов. Инженеры сфокусировались на создании «бесшовного» интерфейса, где модель способна обрабатывать несколько аудиопотоков одновременно, сохраняя контекст беседы даже при возникновении накладок или смене темы пользователем. Это решение закладывает фундамент для массового внедрения агентных систем с голосовым управлением в реальных бизнес-сценариях.
Ключевые факты
- Система GPT-Live обеспечивает непрерывное взаимодействие, исключая необходимость в явных командах на начало или конец фразы.
- Архитектура ориентирована на радикальное снижение задержек, что позволяет ИИ реагировать на прерывания в режиме реального времени.
- Разработка системы заняла шесть месяцев, включая проектирование низкоуровневых протоколов передачи аудио.
- Технология использует подход «turnless» (без очереди), позволяющий модели поддерживать естественный диалог, имитирующий человеческое общение.