Исследователи представили OpenForgeRL — фреймворк для сквозного обучения ИИ-агентов, работающих в сложных средах с использованием внешних инструментов. Решение позволяет интегрировать современные агентные обвязки (harnesses) непосредственно в пайплайны обучения с подкреплением (RL) и дообучения (SFT), устраняя разрыв между сложной логикой вывода и процессами оптимизации моделей, что ранее было технически затруднительно.
Современные агентные системы, такие как Claude Code или OpenClaw, используют многошаговые цепочки рассуждений и доступ к внешним API, что делает их «состояние» динамичным и трудновоспроизводимым для стандартных методов обучения. OpenForgeRL предоставляет инфраструктуру, способную нативно обрабатывать многопроцессные вызовы и сохранять контекст состояния агента в процессе тренировки. Это позволяет обучать модели, которые лучше справляются с долгосрочным планированием и использованием инструментов в реальных условиях.
Данный подход открывает возможности для создания более автономных систем, способных к самообучению через взаимодействие с внешними средами. Вместо того чтобы разделять этап генерации кода и этап исполнения, OpenForgeRL объединяет их в единый цикл, позволяя градиентам проникать через действия агента в его внутренние механизмы принятия решений. Это значительно упрощает разработку агентов, требующих сложной оркестрации.
Ключевые факты
- OpenForgeRL решает проблему несовместимости сложных агентных обвязок с классическими стеками SFT и RL.
- Фреймворк поддерживает нативную работу с многопроцессными средами и сохранение состояния агента в процессе обучения.
- Решение ориентировано на устранение ограничений при создании агентов, использующих внешние системы и инструменты.
- Технология позволяет проводить сквозное обучение моделей, которые ранее требовали сложной ручной настройки логики взаимодействия с окружением.