Компания Prime Intellect представила платформу для масштабного обучения агентов с подкреплением (RL), поддерживающую одновременную работу в 365 000 средах. Система ориентирована на решение сложных задач в области разработки ПО, работы с терминалом и поисковых систем, позволяя значительно ускорить процесс обучения моделей за счет параллелизации и высокой пропускной способности инфраструктуры.

Традиционные подходы к обучению агентов часто ограничены вычислительными ресурсами и сложностью синхронизации множества сред. Новая архитектура позволяет эффективно управлять огромным количеством параллельных сессий, что критически важно для обучения агентов, способных выполнять многошаговые действия в реальных компьютерных интерфейсах. Использование такого масштаба сред помогает агентам быстрее осваивать навыки навигации по файловым системам и взаимодействия с инструментами командной строки.

Разработка направлена на преодоление барьеров в создании автономных систем, способных к полноценному программированию и решению исследовательских задач. Инфраструктура обеспечивает стабильную работу в средах, имитирующих реальные рабочие процессы инженеров, что приближает возможности ИИ к выполнению полноценных задач по написанию и отладке кода без участия человека.

Ключевые факты

  • Платформа поддерживает одновременную работу 365 000 сред для обучения агентов.
  • Основные сценарии использования включают разработку ПО (SWE), работу с терминалом и веб-поиск.
  • Архитектура оптимизирована для обучения с подкреплением (RL), что позволяет агентам обучаться через взаимодействие с интерфейсами.
  • Система направлена на повышение автономности агентов в выполнении сложных многоэтапных задач.