Компании Moonshot AI и kvcache-ai открыли исходный код AgentENV — распределенной системы для обучения ИИ-агентов с использованием обучения с подкреплением (RL). Платформа позволяет запускать изолированные среды в микро-ВМ Firecracker, обеспечивая высокую скорость работы за счет мгновенных снимков состояния и возможности их ветвления, что критически важно для эффективного масштабирования тренировочных процессов в рамках модели Kimi K3.
Система решает проблему низкой производительности при масштабировании агентных сред, предлагая API, совместимый с E2B. Использование микро-ВМ Firecracker гарантирует высокий уровень изоляции и безопасности, а поддержка 16-кратного ветвления (fork) позволяет параллельно тестировать множество сценариев поведения агента в одной и той же среде без необходимости перезапуска всей системы с нуля.
Инструмент ориентирован на разработчиков, занимающихся созданием сложных агентных систем, требующих интенсивного обучения в динамических условиях. Благодаря поддержке снимков состояния с миллисекундной задержкой, AgentENV значительно сокращает время итерации при отладке и дообучении моделей, позволяя эффективно управлять ресурсами при проведении масштабных экспериментов с RL-агентами.
Ключевые факты
- AgentENV распространяется под лицензией MIT и доступен для публичного использования.
- В основе системы лежат микро-ВМ Firecracker, обеспечивающие быструю изоляцию процессов.
- Поддерживается функция 16-стороннего ветвления (fork) для параллельного тестирования агентов.
- API системы полностью совместимо с E2B, что упрощает интеграцию в существующие пайплайны.
- Технология была разработана для поддержки обучения модели Kimi K3 от Moonshot AI.
