Google DeepMind анонсировала Gemini Robotics 2 — новую мультимодальную модель класса VLA (Vision-Language-Action), предназначенную для управления широким спектром робототехнических систем. Решение объединяет визуальное восприятие, понимание естественного языка и планирование действий, позволяя контролировать как компактные настольные манипуляторы, так и полноразмерных гуманоидных роботов, обеспечивая более высокий уровень автономности в выполнении сложных задач.
Ключевым нововведением в архитектуре стала интеграция специализированного слоя высокоуровневого логического рассуждения. В отличие от предыдущих итераций, модель способна не просто распознавать объекты, но и выстраивать последовательности действий для достижения целей в динамической среде. Это позволяет роботам лучше адаптироваться к изменениям в окружении и выполнять многоэтапные инструкции, требующие понимания физического контекста и пространственных отношений.
Разработка направлена на унификацию программного обеспечения для различных типов аппаратного обеспечения. Вместо создания отдельных алгоритмов под каждую конфигурацию манипуляторов или мобильных платформ, Gemini Robotics 2 выступает в роли универсального «мозга». Это значительно упрощает процесс обучения роботов новым навыкам, так как модель использует накопленные знания о физическом мире, полученные в процессе тренировки на огромных массивах данных.
Ключевые факты
- Модель поддерживает работу с различными форм-факторами: от настольных манипуляторов до антропоморфных роботов.
- В архитектуру внедрен новый слой высокоуровневого рассуждения для планирования сложных задач.
- Gemini Robotics 2 объединяет возможности зрения, языка и управления действиями (VLA-модель).
- Система разработана для повышения универсальности робототехники, исключая необходимость индивидуальной настройки под каждый тип оборудования.
