Исследователи предложили новый метод предобучения языковых моделей, основанный на символьных данных и формальных логических выводах. Эксперименты показывают, что обучение на структурированных логических задачах перед переходом к естественному языку значительно повышает эффективность усвоения навыков и улучшает сжимаемость данных, позволяя моделям лучше улавливать сложные закономерности, чем при использовании традиционных алгоритмических примитивов.

Традиционные подходы к предобучению часто опираются на узкие задачи, такие как работа с Dyck-языками или простыми процедурными алгоритмами. Эти методы не способны в полной мере отразить выразительную мощность естественного языка. Новый подход фокусируется на более сложных формальных деривациях, которые создают прочный фундамент для последующего обучения на больших корпусах текстов, обеспечивая более глубокое понимание структуры и логики языка.

Результаты исследования подтверждают, что использование формальных данных на ранних этапах обучения позволяет моделям быстрее достигать высоких показателей производительности. Это открывает новые возможности для оптимизации процесса обучения LLM, делая их более эффективными при ограниченных вычислительных ресурсах и меньших объемах обучающих данных.

Ключевые факты

  • Метод «Logic Before Language» использует символьные данные для формирования логического базиса модели до начала обучения на естественном языке.
  • Формальные деривации позволяют моделям лучше справляться с задачами, требующими глубокого понимания структуры и логических связей.
  • Новый подход демонстрирует повышенную сжимаемость данных, что свидетельствует о более качественном усвоении внутренних закономерностей языка.
  • Исследование преодолевает ограничения предыдущих работ, которые использовали узкие алгоритмические примитивы и малые бюджеты токенов.