Исследователи представили метод Experiential Learning (EL), который меняет парадигму обучения LLM с простого скалярного вознаграждения на использование детальной текстовой обратной связи. Вместо того чтобы сжимать оценку до одного числа, модель-тренер анализирует действия агента и предоставляет структурированные рекомендации, что позволяет эффективнее обучать системы в задачах с открытым финалом, где стандартные метрики часто оказываются неэффективными.
Традиционное обучение с подкреплением (RL) часто страдает от потери информации: при сведении сложной оценки к скалярному значению модель теряет контекст, почему именно ответ был признан качественным или ошибочным. Новый подход превращает классическую модель «LLM-as-a-Judge» в «LLM-as-a-Coach», которая не просто выставляет баллы, а формирует развернутый фидбек. Это позволяет модели-ученику лучше понимать нюансы выполнения задач, которые сложно формализовать через жесткие критерии.
Метод EL позволяет передавать модели-ученику не только итоговый результат, но и цепочку рассуждений тренера. Это значительно улучшает качество генерации в сценариях, где требуется соблюдение специфических стилистических или логических паттернов. Такой подход делает процесс дообучения более прозрачным и позволяет точнее настраивать поведение агентов в сложных прикладных задачах, где важна не только точность, но и следование заданному процессу решения.
Ключевые факты
- Метод Experiential Learning (EL) заменяет скалярное вознаграждение на детальную текстовую обратную связь от модели-тренера.
- Подход решает проблему потери контекста при обучении с подкреплением в задачах с открытым финалом.
- Модель-тренер дистиллирует свои оценки в структурированные советы, которые направляют процесс обучения модели-ученика.
- Технология позволяет эффективно обучать модели в сценариях, где отсутствует возможность автоматической верификации результата через простые метрики.