В 2026 году рынок моделей распознавания речи (ASR) перестал зависеть от доминирования Whisper. Новые решения, такие как Cohere Transcribe, IBM Granite Speech 4.1, ARK-ASR и MOSS-Transcribe, демонстрируют сопоставимую точность, различаясь менее чем на один процентный пункт по метрике WER. Это делает выбор модели зависимым не от лидерства в рейтингах, а от специфических бизнес-задач, лицензий и задержек.
Современный ландшафт ASR-моделей сместился в сторону узкой специализации и оптимизации под конкретные инфраструктурные требования. Разработчики теперь могут выбирать между моделями с поддержкой потоковой передачи данных, высокой скоростью отклика или расширенным охватом языков. Сравнение 16 ключевых open-weight моделей показывает, что разрыв в качестве транскрипции между лидерами индустрии практически нивелирован, что открывает возможности для более гибкого внедрения технологий распознавания голоса в корпоративные продукты.
При выборе модели для продакшена критически важными становятся параметры задержки (latency) и лицензионные ограничения. В то время как точность (WER) у топовых решений находится на одном уровне, различия в архитектурной эффективности позволяют подбирать оптимальные инструменты для систем реального времени, где каждый миллисекундный выигрыш напрямую влияет на пользовательский опыт и стоимость инференса.
Ключевые факты
- В сравнение включено 16 актуальных open-weight моделей распознавания речи.
- Разница в показателе WER (Word Error Rate) между лидерами рынка составляет менее 1%.
- Основными конкурентами Whisper стали Cohere Transcribe, IBM Granite Speech 4.1, ARK-ASR и MOSS-Transcribe.
- Выбор модели теперь базируется на балансе между лицензией, поддержкой языков и задержкой потоковой передачи (streaming latency).
