Исследователи предложили новый подход к обучению LLM, имитирующий человеческую способность превращать опыт в абстрактные стратегии. Модели анализируют свои цепочки рассуждений при решении задач из набора MATH, извлекая из них полезные выводы и предостережения. Эти абстракции затем используются для повышения эффективности решения последующих, более сложных задач, что значительно улучшает показатели точности моделей.
Традиционные методы дообучения часто опираются на прямую имитацию ответов, однако данный подход фокусируется на метапознании. Модель учится не просто копировать верное решение, а формулировать «правила игры» или эвристики, которые помогают избегать типичных ошибок в будущем. В экспериментах использовались как внешние «учителя» для генерации абстракций, так и механизмы саморефлексии, где модель сама выделяет ключевые закономерности из собственных логов.
Результаты показывают, что наличие таких «заметок для себя» позволяет моделям лучше обобщать знания и справляться с задачами, требующими многошагового логического вывода. Этот метод открывает путь к созданию более автономных систем, способных к самообучению в процессе выполнения рабочих операций без необходимости постоянного обновления весов через классический fine-tuning.
Ключевые факты
- Исследование базируется на анализе цепочек рассуждений (solution traces) из датасета MATH.
- Метод предполагает извлечение естественных языковых абстракций, которые служат своего рода «инструкциями» для будущих итераций.
- Подход позволяет моделям самостоятельно формировать стратегии решения, снижая вероятность повторения логических ошибок.
- Механизм применим как при участии более мощных моделей-учителей, так и в режиме самообучения (self-distillation).
- Использование абстрактного опыта повышает общую производительность LLM в задачах, требующих глубокого математического анализа.