Google DeepMind анонсировала Gemini Robotics 2 — специализированную модель, обеспечивающую «целостный интеллект» для робототехники. Система объединяет визуальное восприятие, понимание естественного языка и моторное управление, позволяя роботам выполнять сложные задачи в реальном времени. Технология значительно повышает адаптивность машин к динамическим условиям среды, сокращая время на обучение новым манипуляциям и повышая точность взаимодействия с объектами.

В основе новой разработки лежит архитектура, способная обрабатывать мультимодальные данные непосредственно в процессе движения. В отличие от предыдущих подходов, где планирование и исполнение были разделены, Gemini Robotics 2 интегрирует эти этапы. Это позволяет роботу корректировать свои действия «на лету», если в процессе выполнения задачи изменилось положение предмета или возникло препятствие.

Система демонстрирует способность к обобщению навыков: робот может переносить опыт выполнения одной задачи на другие, схожие по механике, но отличающиеся по контексту. Это приближает индустрию к созданию универсальных роботов-помощников, способных эффективно работать в неструктурированных пространствах, таких как офисы или жилые помещения, без необходимости перепрограммирования под каждую конкретную операцию.

Ключевые факты

  • Gemini Robotics 2 использует мультимодальный подход для одновременной обработки визуальных сигналов и команд управления.
  • Модель обеспечивает «целостный интеллект» (whole body intelligence), координируя движения всех частей робота для выполнения сложных манипуляций.
  • Технология позволяет роботам быстрее адаптироваться к изменениям в окружающей среде без предварительного обучения под каждую задачу.
  • Разработка направлена на повышение автономности робототехники в непредсказуемых условиях реального мира.