Исследователи представили DONDO — семейство открытых моделей для автоматического распознавания речи (ASR), ориентированных на языки Африки. Базой для разработки послужил самообучающийся энкодер w2v-BERT 2.0. В релиз вошли 21 моноязычная и 5 мультиязычных моделей, охватывающих 27 языковых вариаций, распространенных в таких странах, как Нигерия, Кения, Гана, Сенегал, Сьерра-Леоне и Зимбабве.
Разработка направлена на устранение цифрового неравенства в области речевых технологий, где многие региональные языки остаются недостаточно представленными. Использование архитектуры w2v-BERT 2.0 позволило эффективно обучить системы на ограниченных наборах данных, обеспечив высокую точность транскрипции для языков с разной морфологией и фонетическими особенностями. Модели распространяются под разрешительными лицензиями, что упрощает их интеграцию в локальные продукты и исследовательские проекты.
Данный релиз является значимым шагом для развития инклюзивных ИИ-инструментов, так как большинство современных систем распознавания речи оптимизированы преимущественно под глобальные языки. Доступность предобученных весов позволяет разработчикам дообучать системы под специфические диалекты или узкоспециализированные задачи, не тратя ресурсы на создание базовых моделей с нуля.
Ключевые факты
- Семейство DONDO включает 26 моделей: 21 моноязычную и 5 мультиязычных.
- Поддерживается 27 языковых вариаций из шести стран Африки: Ганы, Сьерра-Леоне, Нигерии, Сенегала, Кении и Зимбабве.
- В основе архитектуры лежит самообучающийся речевой энкодер w2v-BERT 2.0.
- Модели выпущены под открытыми разрешительными лицензиями для свободного использования и дообучения.