Исследователи представили CalibForge — систему для автоматического синтеза обучающих задач, предназначенных для ИИ-агентов. Инструмент использует верифицируемое поведение решателей (solvers) для корректировки сложности заданий. Это позволяет создавать динамические наборы данных, которые остаются актуальными и «в меру сложными» по мере прогресса модели, решая проблему статических бенчмарков, которые быстро теряют свою эффективность в процессе обучения.

Традиционные подходы к обучению агентов часто опираются на фиксированные наборы задач, которые либо слишком просты, либо недостижимы для текущего уровня модели. CalibForge меняет этот подход, внедряя цикл обратной связи: система анализирует, как конкретный решатель взаимодействует с задачей, и на основе этого корректирует параметры среды. Это обеспечивает непрерывное усложнение условий, что критически важно для развития навыков планирования и выполнения многошаговых действий.

Методология системы опирается на концепцию «терминальных задач», где выполнение проверяется через исполняемый код или верифицируемые логические условия. Автоматизируя процесс подбора сложности, CalibForge снижает потребность в ручном проектировании обучающих сценариев и позволяет эффективнее использовать вычислительные ресурсы, фокусируя обучение на задачах, находящихся в зоне ближайшего развития агента.

Ключевые факты

  • CalibForge использует автономный синтез задач на основе анализа поведения решателей (solvers).
  • Система обеспечивает верифицируемость выполнения задач, гарантируя их корректность и исполнимость.
  • Метод направлен на решение проблемы стагнации обучения при использовании фиксированных наборов данных.
  • Технология позволяет динамически адаптировать сложность среды под текущие возможности обучаемой модели.