Компания Nymbo представила вторую версию семейства моделей Inflect для синтеза речи (TTS). Новинка включает две версии с 3,9 млн и 9,3 млн параметров, что делает их одними из самых легковесных решений в индустрии. Модели распространяются с открытыми весами, позволяя запускать качественную генерацию голоса на устройствах с крайне ограниченными вычислительными ресурсами.

Разработка ориентирована на сценарии, где критически важны минимальная задержка и низкое потребление памяти. Несмотря на экстремально малый размер, модели демонстрируют высокую разборчивость речи и естественность интонаций, что достигается за счет оптимизированной архитектуры. Это открывает возможности для внедрения голосовых интерфейсов в IoT-устройства, мобильные приложения и локальные системы, не требующие постоянного подключения к облачным серверам.

Использование столь компактных нейросетей позволяет значительно снизить затраты на инференс и упростить развертывание в edge-средах. В отличие от тяжелых трансформеров, Inflect-v2 не требует мощных GPU, что делает технологию доступной для широкого спектра аппаратных платформ, включая микроконтроллеры и бюджетные мобильные процессоры.

Ключевые факты

  • Представлены две версии модели: с 3,9 млн и 9,3 млн параметров.
  • Модели распространяются с открытыми весами на платформе Hugging Face.
  • Архитектура оптимизирована для работы на устройствах с низким энергопотреблением и ограниченной памятью.
  • Релиз направлен на развитие локальных систем синтеза речи без необходимости облачного инференса.