Исследователи представили новый подход к GUI-grounding, который позволяет мультимодальным моделям точнее взаимодействовать с интерфейсами. Метод Regression-Free Layout-Aware Matching исключает зависимость от метаданных, фокусируясь на анализе скриншотов. Это решает проблему галлюцинаций, когда агенты ошибочно интерпретируют элементы управления, обеспечивая высокую точность сопоставления инструкций пользователя с координатами объектов на экране.

Современные GUI-агенты постепенно отказываются от использования DOM-структур и метаданных в пользу чисто визуального восприятия через MLLM. Однако стандартные модели часто сталкиваются с трудностями при интерпретации сложных интерфейсов, где семантическая нагрузка элементов не всегда очевидна. Предложенный алгоритм вводит механизм сопоставления, учитывающий пространственную компоновку элементов, что позволяет агенту «видеть» интерфейс подобно человеку, избегая ошибок при кликах или вводе данных.

Технология опирается на иерархический анализ визуальных признаков, что критически важно для автоматизации процессов в приложениях, где структура кода недоступна или динамически меняется. Использование такого подхода повышает надежность агентных систем в реальных сценариях, где требуется высокая точность позиционирования курсора и распознавания интерактивных зон без необходимости глубокой интеграции с внутренним API целевого софта.

Ключевые факты

  • Метод исключает использование метаданных, переходя к чисто визуальному анализу скриншотов.
  • Алгоритм Regression-Free Layout-Aware Matching минимизирует галлюцинации при определении координат элементов.
  • Подход ориентирован на повышение точности выполнения инструкций в мультимодальных моделях (MLLM).
  • Решение позволяет агентам работать с любыми интерфейсами, где доступен визуальный вывод, независимо от сложности верстки.