Исследователи представили DataOrchestra — фреймворк для динамической обработки данных при предварительном обучении языковых моделей. В отличие от стандартных подходов, применяющих единые правила фильтрации ко всему корпусу, система подбирает индивидуальную стратегию обработки для каждого примера. Это позволяет повысить качество обучающей выборки и существенно улучшить итоговую производительность моделей, эффективно отсеивая шум и нерелевантный контент.

Традиционные методы подготовки данных часто опираются на жесткие эвристики, которые действуют на уровне доменов или целых наборов данных. DataOrchestra объединяет различные операции обработки в единый конвейер, где модель обучается принимать решение о том, как именно нужно подготовить конкретный фрагмент текста. Такой подход позволяет учитывать уникальные характеристики каждого примера, что критически важно для обучения моделей на больших и разнородных массивах данных.

Использование адаптивной оркестрации решает проблему «усредненного» качества данных, когда агрессивная фильтрация может удалить полезную информацию, а слабая — оставить вредный «мусор». Авторы фреймворка демонстрируют, что автоматизированный выбор операций обработки на уровне отдельных примеров позволяет достичь более высоких показателей в бенчмарках при меньших затратах вычислительных ресурсов на этапе подготовки датасета.

Ключевые факты

  • DataOrchestra внедряет адаптивную стратегию обработки данных вместо фиксированных правил для всего корпуса.
  • Фреймворк унифицирует различные операции очистки и подготовки, позволяя системе самостоятельно выбирать оптимальный путь обработки для каждого примера.
  • Метод направлен на повышение качества предварительного обучения (pretraining) LLM за счет более точного отбора и подготовки данных.
  • Подход снижает влияние шума в обучающих выборках, что напрямую коррелирует с улучшением метрик производительности моделей в downstream-задачах.