Исследователи представили пайплайн для создания синтетических параллельных корпусов, необходимых для обучения систем машинного перевода редких языков. Вместо использования грамматических справочников в контексте промптов при инференсе, метод извлекает из них правила, лексику и примеры предложений с помощью LLM. Это позволяет эффективно дообучать модели для языков с крайне ограниченным объемом цифровых данных.
Проблема нехватки параллельных текстов является основным барьером для развития качественного машинного перевода для исчезающих языков. Традиционные подходы часто опираются на скудные наборы данных, что приводит к низкой точности. Новый метод переводит накопленные десятилетиями лингвистические знания из печатных грамматических книг в машиночитаемый формат, создавая качественные обучающие выборки.
Использование синтетических данных, сгенерированных на основе строгих грамматических правил, позволяет моделям лучше улавливать морфологические и синтаксические особенности редких языков. Такой подход значительно повышает качество перевода по сравнению с методами, полагающимися исключительно на общие знания LLM или ограниченные параллельные корпуса.
Ключевые факты
- Разработан автоматизированный пайплайн для извлечения грамматических правил, лексиконов и примеров из специализированных лингвистических справочников.
- Метод ориентирован на языки с низкими ресурсами (low-resource languages), для которых отсутствуют масштабные параллельные датасеты.
- Синтетические данные используются для дообучения (fine-tuning) моделей, что обеспечивает более стабильный результат, чем подача грамматических данных в промпт при инференсе.
- Исследование демонстрирует способ преодоления дефицита данных путем оцифровки и структурирования накопленного академического лингвистического опыта.