Исследователи представили метод Evidence-Aware Reinforcement Learning (EARL), направленный на устранение проблемы «повторяющегося копирования» в больших языковых моделях. При работе с длинными контекстами модели часто склонны механически переносить фрагменты входных данных в цепочку рассуждений вместо выполнения логического анализа. Новый подход через обучение с подкреплением приучает ИИ фокусироваться на доказательствах, повышая точность решения сложных задач.
Проблема избыточного копирования становится критической при увеличении объема входных данных, так как модели начинают «застревать» на цитировании контекста, теряя нить рассуждений. Это приводит к деградации качества ответов, несмотря на формально доступный большой контекст. Авторы работы проанализировали поведение моделей и выявили, что текущие методы обучения часто поощряют воспроизведение текста, что негативно сказывается на способности к синтезу информации.
Метод EARL вводит механизм оценки «доказательности» (evidence-awareness), который штрафует модель за необоснованное дублирование входных токенов. В процессе обучения система учится различать полезное цитирование, необходимое для обоснования ответа, и избыточное копирование, которое не несет аналитической нагрузки. Это позволяет моделям эффективнее использовать длинные документы, сохраняя фокус на логических шагах, необходимых для достижения верного результата.
Ключевые факты
- Проблема «повторяющегося копирования» (repetitive copying) идентифицирована как основной барьер для качественного рассуждения в длинных контекстах.
- Метод EARL использует обучение с подкреплением для приоритизации релевантных доказательств над простым воспроизведением текста.
- Новый подход позволяет значительно снизить объем «шумовых» повторов в цепочках рассуждений (reasoning traces).
- Исследование направлено на повышение эффективности использования контекстного окна в задачах, требующих глубокого анализа больших объемов данных.