Исследователи предложили архитектурный подход SLIME (Scalable Learning with Independent Model Execution), решающий проблему «бутылочного горлышка» в обучении с подкреплением (RL). Метод разделяет процессы генерации траекторий и обновления модели, позволяя независимо масштабировать вычислительные ресурсы для инференса и обучения. Это ускоряет итерации при создании сложных ИИ-агентов, требующих интенсивного взаимодействия со средой для накопления опыта.
Традиционные системы RL часто ограничены скоростью генерации данных: пока модель обучается на собранных примерах, она не может эффективно взаимодействовать с окружением, что приводит к простоям GPU. SLIME переносит генерацию траекторий на распределенные узлы, которые работают асинхронно. Это позволяет использовать тысячи параллельных агентов для сбора данных, не дожидаясь завершения градиентного спуска на центральном сервере.
Такой подход критически важен для агентных систем, где обучение требует длительного исследования пространства состояний. Разделение инференса и обучения позволяет гибко настраивать инфраструктуру: выделять больше ресурсов под «исследователей» (агентов) и оптимизировать вычислительные мощности под «обучающегося» (модель). Это снижает стоимость экспериментов и сокращает время до сходимости алгоритмов в сложных задачах.
Ключевые факты
- SLIME (Scalable Learning with Independent Model Execution) разделяет циклы сбора данных и обновления весов модели.
- Метод позволяет масштабировать количество параллельных агентов независимо от пропускной способности обучающего кластера.
- Архитектура устраняет простои GPU, возникающие при синхронном обучении с подкреплением.
- Подход ориентирован на ускорение разработки агентов, требующих глубокого обучения в динамических средах.
- Реализация позволяет эффективно использовать гетерогенные вычислительные ресурсы для разных этапов жизненного цикла модели.