Исследователи выявили критическую уязвимость в моделях визуального обоснования (GUI grounding), которые управляют интерфейсами через генерацию экранных координат. Атака под названием MissClick позволяет злоумышленникам манипулировать предсказаниями модели, заставляя её совершать неверные клики. Метод эксплуатирует способ парсинга числовых токенов, где незначительное изменение сгенерированной цифры приводит к существенному смещению точки нажатия на экране.

Современные агентные системы, взаимодействующие с графическими интерфейсами, преобразуют координаты в последовательности цифровых токенов. Модели предсказывают каждую цифру независимо, не учитывая семантическую связь между разрядами числа. Исследователи доказали, что добавление минимальных возмущений в процесс генерации токенов позволяет перенаправить курсор агента на вредоносные элементы управления, такие как кнопки подтверждения транзакций или удаления данных, вместо целевых объектов.

Эта проблема подчеркивает фундаментальный риск в архитектуре текущих мультимодальных моделей, используемых для автоматизации действий в браузере или ОС. Поскольку агент доверяет сгенерированным координатам как «истинным», он может непреднамеренно выполнить опасное действие, даже если визуально распознал объект верно. Исследование предлагает пересмотреть методы вывода координат, чтобы исключить возможность подобных манипуляций на уровне токенизации.

Ключевые факты

  • Атака MissClick эксплуатирует уязвимость в парсинге координат, представленных как последовательности отдельных цифровых токенов.
  • Изменение цифры в старшем разряде при генерации приводит к критическому смещению целевой точки клика на интерфейсе.
  • Уязвимость позволяет злоумышленникам подменять легитимные действия агента на вредоносные, используя минимальные возмущения в генерации.
  • Исследование указывает на необходимость изменения архитектуры GUI-агентов, чтобы предотвратить ошибки интерпретации пространственных данных.