NVIDIA выпустила Molt — PyTorch-ориентированный фреймворк для разработки агентных систем с обучением с подкреплением (RL). Решение объединяет Ray, vLLM и NeMo AutoModel в единый асинхронный цикл, позволяя исследователям модифицировать алгоритмы без переписывания инфраструктуры обучения. Система поддерживает сохранение точных токенных траекторий и обеспечивает высокую пропускную способность при работе с агентными моделями.
Традиционные подходы к RL-исследованиям требуют глубокой интеграции изменений в тренеры, распределенные бэкенды и системы сбора данных. Molt минимизирует эти затраты, предоставляя компактную кодовую базу объемом около 8,6 тысяч строк. Это позволяет разработчикам сосредоточиться на логике агента, используя стандартный Python, в то время как фреймворк берет на себя управление сложными процессами распределенных вычислений и инференса.
Использование Molt упрощает масштабирование агентных систем, сохраняя при этом гибкость для экспериментов с архитектурой моделей. Интеграция с vLLM позволяет эффективно обрабатывать запросы в процессе обучения, что критически важно для агентных сценариев, требующих высокой скорости генерации и обработки последовательностей. Фреймворк ориентирован на создание высокопроизводительных сред, где агент должен обучаться в динамических условиях.
Ключевые факты
- Molt реализован на базе PyTorch и содержит около 8,6 тысяч строк кода, отвечающих за логику RL.
- В архитектуру фреймворка интегрированы Ray для распределенных вычислений, vLLM для ускорения инференса и NeMo AutoModel.
- Система использует единый асинхронный цикл для управления взаимодействием агента и среды.
- Фреймворк поддерживает работу с токен-точными траекториями, что обеспечивает воспроизводимость результатов обучения.
- Решение нацелено на снижение сложности модификации алгоритмов в агентных RL-системах.
