Исследователи представили метод TurnSight, улучшающий способность языковых моделей к рассуждению при работе с внешними инструментами. В отличие от традиционного обучения на уровне всей траектории, подход фокусируется на пошаговой самодистилляции. Это позволяет модели точнее оценивать промежуточные действия и исправлять ошибки в длинных цепочках рассуждений, повышая общую надежность агентных систем.
В задачах, требующих интеграции инструментов (Tool-Integrated Reasoning), модели часто сталкиваются с проблемой распределения ответственности за успех или провал всей операции. Обычные методы обучения с подкреплением не дают достаточно плотных сигналов для обучения на каждом этапе взаимодействия. TurnSight решает эту задачу, используя «привилегированный контекст» в учительских ветках, что обеспечивает более детальную обратную связь для обучаемой модели.
Метод позволяет эффективно использовать накопленный опыт для коррекции стратегии на каждом шаге. Это критически важно для сложных сценариев, где ошибка на раннем этапе приводит к неверному результату всей цепочки действий. Техника самодистилляции на уровне отдельных ходов (turn-level) значительно упрощает процесс обучения агентов, делая их более устойчивыми к неопределенности при вызове внешних API или баз данных.
Ключевые факты
- Метод TurnSight переносит фокус обучения с оценки всей траектории на анализ каждого отдельного шага взаимодействия с инструментом.
- Использование учительских веток с привилегированным контекстом обеспечивает более плотные и точные сигналы для обучения модели.
- Подход направлен на решение проблемы неэффективного распределения кредита (credit assignment) в длинных цепочках рассуждений.
- Техника ориентирована на повышение качества Tool-Integrated Reasoning (TIR) в сложных агентных сценариях.