Nvidia представила NemotronLabs VoiceChat 11B — специализированную языковую модель, оптимизированную для полнодуплексного голосового взаимодействия в реальном времени. Модель поддерживает вызов внешних инструментов (tool calling), что позволяет интегрировать её в агентные системы для выполнения конкретных задач. Релиз ориентирован на создание отзывчивых голосовых интерфейсов с минимальной задержкой при обработке запросов.
Архитектура модели настроена на эффективную работу с разговорной речью, что критически важно для снижения задержек в диалоговых системах. Возможность вызова инструментов расширяет функциональность модели за пределы простого общения, позволяя агенту взаимодействовать с API, базами данных или локальными сервисами непосредственно в ходе голосовой сессии.
Данный релиз дополняет экосистему инструментов Nvidia для разработчиков разговорного ИИ. Модель доступна на платформе Hugging Face и может быть развернута в инфраструктурах, поддерживающих современные методы инференса для LLM среднего размера, обеспечивая баланс между производительностью и требованиями к вычислительным ресурсам.
Ключевые факты
- Модель NemotronLabs VoiceChat имеет 11 миллиардов параметров.
- Поддерживается полнодуплексный режим работы, позволяющий прерывать ИИ во время генерации речи.
- Реализована нативная поддержка вызова внешних инструментов (tool calling).
- Модель оптимизирована для сценариев с низкой задержкой (low-latency) в реальном времени.
- Релиз опубликован в открытом доступе на платформе Hugging Face под брендом Nvidia.