Исследователи проанализировали шесть различных способов представления веб-контента для ИИ-агентов, включая текстовые и визуальные данные. Выяснилось, что выбор метода восприятия критически влияет на успех выполнения задач, при этом оптимальный подход меняется в зависимости от конкретного сайта и модели. Динамическая маршрутизация между этими методами для каждой задачи дает значительный прирост производительности, но остается сложной для обучения.
В работе оценивались восемь комбинаций моделей и веб-сайтов на базе бенчмарков VisualWebArena и WebArena. Авторы обнаружили, что различные режимы наблюдения — будь то чистый текст, скриншоты или их комбинации — дополняют друг друга. Каждый из них имеет уникальные сильные стороны и специфические сценарии отказа, что делает невозможным выбор одного универсального метода для всех типов взаимодействия с браузером.
Основная проблема заключается в том, что текущие системы часто фиксируют способ получения данных на этапе проектирования. Однако результаты показывают, что «маршрутизация» — выбор наиболее подходящего режима представления данных под конкретную задачу — является наиболее ценной именно там, где её сложнее всего автоматизировать. Это указывает на необходимость разработки более гибких архитектур агентов, способных адаптировать способ «зрения» в процессе выполнения цепочки действий.
Ключевые факты
- Протестировано шесть различных режимов наблюдения за браузером (текстовые, визуальные и гибридные).
- Исследование проведено на восьми комбинациях моделей и сайтов с использованием бенчмарков VisualWebArena и WebArena.
- Установлено, что оптимальный выбор метода восприятия данных часто меняется в зависимости от структуры сайта и архитектуры модели.
- Динамическая маршрутизация между режимами наблюдения обеспечивает существенное повышение точности выполнения задач по сравнению с использованием фиксированного метода.