Nvidia представила NemotronLabs VoiceChat 11B — специализированную языковую модель, оптимизированную для полнодуплексного голосового взаимодействия в реальном времени. Модель поддерживает вызов внешних инструментов (tool calling), что позволяет интегрировать её в агентные системы для выполнения конкретных задач. Релиз ориентирован на создание отзывчивых голосовых интерфейсов с минимальной задержкой при обработке запросов.

Архитектура модели настроена на эффективную работу с разговорной речью, что критически важно для снижения задержек в диалоговых системах. Возможность вызова инструментов расширяет функциональность модели за пределы простого общения, позволяя агенту взаимодействовать с API, базами данных или локальными сервисами непосредственно в ходе голосовой сессии.

Данный релиз дополняет экосистему инструментов Nvidia для разработчиков разговорного ИИ. Модель доступна на платформе Hugging Face и может быть развернута в инфраструктурах, поддерживающих современные методы инференса для LLM среднего размера, обеспечивая баланс между производительностью и требованиями к вычислительным ресурсам.

Ключевые факты

  • Модель NemotronLabs VoiceChat имеет 11 миллиардов параметров.
  • Поддерживается полнодуплексный режим работы, позволяющий прерывать ИИ во время генерации речи.
  • Реализована нативная поддержка вызова внешних инструментов (tool calling).
  • Модель оптимизирована для сценариев с низкой задержкой (low-latency) в реальном времени.
  • Релиз опубликован в открытом доступе на платформе Hugging Face под брендом Nvidia.