Google анонсировала Gemini Robotics 2.0 — специализированную версию своей мультимодальной модели, предназначенную для управления робототехникой. Новая архитектура значительно повышает точность манипуляций и уровень безопасности при взаимодействии с физическими объектами. Решение направлено на интеграцию продвинутого ИИ-мышления в автономные системы, позволяя роботам лучше понимать контекст среды и выполнять сложные задачи с высокой степенью автономности.
Разработка базируется на способности модели обрабатывать визуальные и сенсорные данные в реальном времени, что критически важно для динамических сред. В отличие от предыдущих итераций, версия 2.0 лучше справляется с задачами, требующими мелкой моторики и адаптации к непредвиденным изменениям в пространстве. Это делает систему пригодной для использования как в складской логистике, так и в более сложных сервисных сценариях.
Особое внимание в обновлении уделено протоколам безопасности. Модель включает встроенные механизмы контроля, которые предотвращают совершение опасных действий при интерпретации команд. Это достигается за счет глубокого обучения на симуляциях, где роботы отрабатывают тысячи сценариев взаимодействия, минимизируя риски повреждения оборудования или травмирования людей в процессе эксплуатации.
Ключевые факты
- Gemini Robotics 2.0 обеспечивает повышенную точность движений манипуляторов за счет улучшенной обработки мультимодальных сигналов.
- Внедрены новые алгоритмы безопасности, ограничивающие выполнение команд, которые могут привести к физическому ущербу.
- Модель способна обрабатывать визуальные данные с камер робота с минимальной задержкой, что критично для навигации.
- Система прошла обучение на расширенных наборах данных, включающих сложные сценарии взаимодействия с объектами разной формы и плотности.