Google DeepMind выпустила Gemini Robotics 2 — комплексную интеллектуальную платформу для управления робототехникой. Релиз включает три специализированные модели, отвечающие за координацию движений всего тела гуманоидов, логическое планирование задач и адаптацию к различным аппаратным конфигурациям. Технология уже успешно протестирована на промышленных роботах, демонстрируя способность к быстрой настройке под новые физические платформы.

Новая архитектура направлена на решение проблемы фрагментации в робототехнике, где для каждого устройства требовалось индивидуальное обучение. Модели серии Gemini Robotics 2 позволяют унифицировать процесс управления, обеспечивая высокую точность манипуляций и возможность взаимодействия нескольких роботов в рамках одной рабочей среды. Внедрение VLA-моделей (Vision-Language-Action) позволяет роботам интерпретировать визуальные данные и преобразовывать их в конкретные физические действия в режиме реального времени.

Особое внимание уделено адаптивности: локальная версия модели способна подстроиться под новую кинематическую схему робота всего за несколько часов обучения. Это значительно сокращает время развертывания автоматизированных систем в логистике и производстве. Использование единого «интеллектуального слоя» упрощает оркестрацию сложных задач, требующих участия нескольких автономных агентов, работающих сообща.

Ключевые факты

  • В состав релиза вошли три модели: для управления всем телом гуманоида, для воплощенного рассуждения (ER 2) и адаптивная on-device VLA-модель.
  • Платформа уже интегрирована с роботами Apptronik Apollo 2 и Franka Duo.
  • Модели обеспечивают мультироботизированное сотрудничество, позволяя координировать действия нескольких юнитов для выполнения общей задачи.
  • Время адаптации модели к новому типу робототехнического оборудования сокращено до нескольких часов.
  • Решение позиционируется как фундаментальный интеллектуальный слой для следующего поколения автономных роботов.