Исследователи выявили критическую уязвимость мультимодальных моделей (MLLM) при генерации фронтенд-кода по скриншотам. Оказалось, что модели склонны отдавать предпочтение повторяющимся визуальным паттернам в ущерб точности кода. Для оценки этой проблемы авторы представили первый специализированный бенчмарк, измеряющий предвзятость моделей при выполнении задач по заполнению пропусков в коде на основе визуальных данных.
В ходе экспериментов выяснилось, что MLLM часто игнорируют уникальные детали интерфейса, если они противоречат привычным шаблонам, заложенным в обучающей выборке. Это приводит к тому, что сгенерированный код визуально выглядит корректным, но функционально не соответствует исходному макету. Проблема «завершения паттерна» (pattern completion bias) становится серьезным препятствием для автоматизации верстки, так как модели склонны галлюцинировать стандартные элементы там, где требуются специфические решения.
Разработанный бенчмарк позволяет количественно измерить, насколько сильно конкретная модель подвержена влиянию визуальных повторов. Это дает разработчикам инструмент для оценки надежности моделей перед внедрением в пайплайны автоматической генерации интерфейсов. Результаты подчеркивают необходимость улучшения механизмов внимания в мультимодальных архитектурах, чтобы они могли точнее сопоставлять визуальные признаки с логикой программного кода.
Ключевые факты
- Исследование сфокусировано на проблеме «предвзятости завершения паттерна» в мультимодальных LLM при переводе скриншотов в код.
- Разработан первый специализированный бенчмарк для тестирования точности моделей в задачах «заполнения пропусков» (fill-in-the-blank) на основе визуальных данных.
- Выявлено, что модели систематически отдают приоритет визуально привычным шаблонам, игнорируя фактические различия в предоставленных скриншотах.
- Работа указывает на риск снижения функциональной точности кода при использовании MLLM для автоматизации фронтенд-разработки.