Исследователи проанализировали уязвимости воплощенного ИИ (Embodied AI), использующего модели мира для планирования и прогнозирования действий. В отличие от стандартных LLM, такие системы преобразуют сенсорные данные в предсказательные состояния, что создает новые векторы атак. Компрометация данных или промптов в этих моделях может привести к опасным физическим последствиям, требуя пересмотра подходов к безопасности на всех этапах жизненного цикла ИИ.

Модели мира позволяют роботам и автономным системам симулировать будущие состояния среды, выходя за рамки простого реактивного управления. Однако этот механизм становится критической точкой отказа: злоумышленник, внедривший искажения в процесс сжатия наблюдений или в механизм симуляции, может манипулировать физическим поведением агента. Угрозы распространяются от манипуляций с датчиками до отравления обучающих выборок, на которых строится внутренняя «картина мира» системы.

Авторы обзора предлагают классификацию угроз, разделяя их по этапам жизненного цикла: от сбора данных и обучения до фазы исполнения в реальном времени. Особое внимание уделяется методам защиты, включая верификацию предсказаний модели и внедрение механизмов контроля, которые позволяют системе распознавать аномалии в симуляции до того, как они будут преобразованы в команды для приводов или манипуляторов.

Ключевые факты

  • Модели мира критически уязвимы на этапах сжатия сенсорных данных, симуляции будущих состояний и планирования действий.
  • Векторы атак включают манипуляции с датчиками, инъекции в промпты и отравление данных, используемых для обучения предсказательного ядра.
  • Безопасность воплощенного ИИ требует комплексного подхода, объединяющего кибербезопасность с методами контроля физических систем.
  • Исследование охватывает полный жизненный цикл угроз: от подготовки данных до исполнения команд в физической среде.