Компания Prime Intellect представила платформу для масштабного обучения агентов с подкреплением (RL), поддерживающую одновременную работу в 365 000 средах. Система ориентирована на решение сложных задач в области разработки ПО, работы с терминалом и поисковых систем, позволяя значительно ускорить процесс обучения моделей за счет параллелизации и высокой пропускной способности инфраструктуры.
Традиционные подходы к обучению агентов часто ограничены вычислительными ресурсами и сложностью синхронизации множества сред. Новая архитектура позволяет эффективно управлять огромным количеством параллельных сессий, что критически важно для обучения агентов, способных выполнять многошаговые действия в реальных компьютерных интерфейсах. Использование такого масштаба сред помогает агентам быстрее осваивать навыки навигации по файловым системам и взаимодействия с инструментами командной строки.
Разработка направлена на преодоление барьеров в создании автономных систем, способных к полноценному программированию и решению исследовательских задач. Инфраструктура обеспечивает стабильную работу в средах, имитирующих реальные рабочие процессы инженеров, что приближает возможности ИИ к выполнению полноценных задач по написанию и отладке кода без участия человека.
Ключевые факты
- Платформа поддерживает одновременную работу 365 000 сред для обучения агентов.
- Основные сценарии использования включают разработку ПО (SWE), работу с терминалом и веб-поиск.
- Архитектура оптимизирована для обучения с подкреплением (RL), что позволяет агентам обучаться через взаимодействие с интерфейсами.
- Система направлена на повышение автономности агентов в выполнении сложных многоэтапных задач.