Исследователи представили ABSeeker — новый метод обучения ИИ-агентов для выполнения многошаговых задач поиска и верификации информации. В отличие от стандартных подходов, равномерно оценивающих все действия в цепочке, ABSeeker использует механизм обратного отслеживания ответов (answer-backtracking) для точного распределения кредита (credit assignment) между полезными и избыточными шагами в процессе рассуждения.
При выполнении сложных запросов агенты часто совершают ошибки на промежуточных этапах, что затрудняет обучение при использовании классического обучения с подкреплением (RL) или SFT. Новый алгоритм анализирует траекторию поиска в обратном порядке от итогового ответа, выявляя, какие именно действия привели к успеху, а какие были ошибочными или лишними. Это позволяет модели эффективнее фокусироваться на релевантных этапах извлечения и интеграции данных.
Применение данного метода значительно повышает точность агентов в задачах, требующих глубокого анализа и многоступенчатого поиска доказательств. Разделение вклада каждого шага в финальный результат минимизирует шум в обучающих данных, что критически важно для создания надежных систем, способных к автономной работе над долгосрочными задачами без постоянного контроля со стороны пользователя.
Ключевые факты
- Метод ABSeeker внедряет механизм обратного отслеживания (answer-backtracking) для оценки вклада каждого действия в итоговый результат.
- Алгоритм решает проблему «зашумленных» траекторий, где полезные действия смешиваются с избыточными или ошибочными шагами.
- Подход оптимизирует процессы обучения с подкреплением (RL) и supervised fine-tuning (SFT) для агентов, работающих с длинными горизонтами планирования.
- Технология направлена на повышение качества поиска, верификации и синтеза информации в сложных агентных системах.