OpenAI расширила линейку своих моделей, выпустив GPT-transcribe и GPT-live-transcribe. Новые решения ориентированы на высокоточную обработку аудиоданных: первая модель предназначена для пакетной транскрибации файлов, а вторая обеспечивает потоковую обработку в реальном времени. Инструменты призваны повысить эффективность работы с голосовым контентом в корпоративных приложениях и сервисах автоматизации.

Запуск этих моделей знаменует переход OpenAI к более узкоспециализированным решениям, которые оптимизированы под конкретные задачи обработки аудио. В отличие от универсальных мультимодальных моделей, данные инструменты сфокусированы на снижении задержек и повышении качества распознавания речи в различных акустических условиях. Это позволяет разработчикам интегрировать функции перевода и расшифровки аудио в свои продукты с предсказуемой производительностью.

Интеграция новых моделей доступна через обновленный API, что упрощает внедрение функционала в существующие пайплайны обработки данных. Использование специализированных моделей вместо общих архитектур позволяет компаниям оптимизировать затраты на инференс при работе с большими объемами аудиопотоков, сохраняя при этом высокую точность распознавания текста.

Ключевые факты

  • GPT-transcribe предназначена для обработки аудиофайлов в пакетном режиме.
  • GPT-live-transcribe обеспечивает минимальную задержку при транскрибации аудио в реальном времени.
  • Новые модели доступны для интеграции через официальный API OpenAI.
  • Релиз направлен на повышение производительности и снижение стоимости обработки аудиоданных в бизнес-приложениях.