Компании Moonshot AI и kvcache-ai открыли исходный код AgentENV — распределенной системы для обучения ИИ-агентов с использованием обучения с подкреплением (RL). Платформа позволяет запускать изолированные среды в микро-ВМ Firecracker, обеспечивая высокую скорость работы за счет мгновенных снимков состояния и возможности их ветвления, что критически важно для эффективного масштабирования тренировочных процессов в рамках модели Kimi K3.

Система решает проблему низкой производительности при масштабировании агентных сред, предлагая API, совместимый с E2B. Использование микро-ВМ Firecracker гарантирует высокий уровень изоляции и безопасности, а поддержка 16-кратного ветвления (fork) позволяет параллельно тестировать множество сценариев поведения агента в одной и той же среде без необходимости перезапуска всей системы с нуля.

Инструмент ориентирован на разработчиков, занимающихся созданием сложных агентных систем, требующих интенсивного обучения в динамических условиях. Благодаря поддержке снимков состояния с миллисекундной задержкой, AgentENV значительно сокращает время итерации при отладке и дообучении моделей, позволяя эффективно управлять ресурсами при проведении масштабных экспериментов с RL-агентами.

Ключевые факты

  • AgentENV распространяется под лицензией MIT и доступен для публичного использования.
  • В основе системы лежат микро-ВМ Firecracker, обеспечивающие быструю изоляцию процессов.
  • Поддерживается функция 16-стороннего ветвления (fork) для параллельного тестирования агентов.
  • API системы полностью совместимо с E2B, что упрощает интеграцию в существующие пайплайны.
  • Технология была разработана для поддержки обучения модели Kimi K3 от Moonshot AI.