Компания Nymbo представила вторую версию семейства моделей Inflect для синтеза речи (TTS). Новинка включает две версии с 3,9 млн и 9,3 млн параметров, что делает их одними из самых легковесных решений в индустрии. Модели распространяются с открытыми весами, позволяя запускать качественную генерацию голоса на устройствах с крайне ограниченными вычислительными ресурсами.
Разработка ориентирована на сценарии, где критически важны минимальная задержка и низкое потребление памяти. Несмотря на экстремально малый размер, модели демонстрируют высокую разборчивость речи и естественность интонаций, что достигается за счет оптимизированной архитектуры. Это открывает возможности для внедрения голосовых интерфейсов в IoT-устройства, мобильные приложения и локальные системы, не требующие постоянного подключения к облачным серверам.
Использование столь компактных нейросетей позволяет значительно снизить затраты на инференс и упростить развертывание в edge-средах. В отличие от тяжелых трансформеров, Inflect-v2 не требует мощных GPU, что делает технологию доступной для широкого спектра аппаратных платформ, включая микроконтроллеры и бюджетные мобильные процессоры.
Ключевые факты
- Представлены две версии модели: с 3,9 млн и 9,3 млн параметров.
- Модели распространяются с открытыми весами на платформе Hugging Face.
- Архитектура оптимизирована для работы на устройствах с низким энергопотреблением и ограниченной памятью.
- Релиз направлен на развитие локальных систем синтеза речи без необходимости облачного инференса.