Компания Anthropic представила исследование, демонстрирующее способность модели Claude 3.5 Sonnet управлять робототехническими системами. ИИ анализирует визуальные данные с камер в реальном времени и преобразует их в последовательность команд для манипуляторов. Система демонстрирует высокую точность выполнения задач, требующих координации движений и понимания физического пространства, без необходимости специализированного обучения под конкретное оборудование.

В основе подхода лежит использование возможностей модели по интерпретации визуального контекста и генерации кода. Вместо традиционного программирования траекторий, модель получает поток изображений и текстовую инструкцию, после чего самостоятельно определяет необходимые действия для достижения цели. Это позволяет сократить время на настройку роботов и расширяет возможности применения LLM в физическом мире.

Исследование подчеркивает потенциал мультимодальных моделей как «мозга» для автономных агентов. В ходе тестов Claude успешно справлялась с задачами захвата объектов и навигации в динамической среде, адаптируясь к изменениям в расположении предметов. Такой метод взаимодействия открывает путь к созданию более гибких промышленных и бытовых роботов, способных выполнять сложные манипуляции на основе естественного языка.

Ключевые факты

  • В экспериментах использовалась модель Claude 3.5 Sonnet, обладающая улучшенными способностями к визуальному восприятию.
  • Система работает через интерпретацию видеопотока, что позволяет модели «видеть» прогресс выполнения задачи и корректировать действия.
  • Метод исключает необходимость создания специфических датасетов для каждого типа движений, полагаясь на общие знания модели о физических объектах.
  • Тестирование проводилось на задачах манипуляции, требующих точности позиционирования и оценки расстояния до объектов в реальном времени.