Исследователи представили пайплайн для создания синтетических параллельных корпусов, необходимых для обучения систем машинного перевода редких языков. Вместо использования грамматических справочников в контексте промптов при инференсе, метод извлекает из них правила, лексику и примеры предложений с помощью LLM. Это позволяет эффективно дообучать модели для языков с крайне ограниченным объемом цифровых данных.

Проблема нехватки параллельных текстов является основным барьером для развития качественного машинного перевода для исчезающих языков. Традиционные подходы часто опираются на скудные наборы данных, что приводит к низкой точности. Новый метод переводит накопленные десятилетиями лингвистические знания из печатных грамматических книг в машиночитаемый формат, создавая качественные обучающие выборки.

Использование синтетических данных, сгенерированных на основе строгих грамматических правил, позволяет моделям лучше улавливать морфологические и синтаксические особенности редких языков. Такой подход значительно повышает качество перевода по сравнению с методами, полагающимися исключительно на общие знания LLM или ограниченные параллельные корпуса.

Ключевые факты

  • Разработан автоматизированный пайплайн для извлечения грамматических правил, лексиконов и примеров из специализированных лингвистических справочников.
  • Метод ориентирован на языки с низкими ресурсами (low-resource languages), для которых отсутствуют масштабные параллельные датасеты.
  • Синтетические данные используются для дообучения (fine-tuning) моделей, что обеспечивает более стабильный результат, чем подача грамматических данных в промпт при инференсе.
  • Исследование демонстрирует способ преодоления дефицита данных путем оцифровки и структурирования накопленного академического лингвистического опыта.