Исследователи представили LiveEvalBench — новый бенчмарк для оценки способности LLM создавать интерактивные веб-приложения. В отличие от статических тестов, которые проверяют код на соответствие фиксированным шаблонам, LiveEvalBench учитывает динамическую природу фронтенда. Система оценивает функциональность и корректность сгенерированных артефактов в реальных браузерных средах, что позволяет точнее измерять пригодность моделей для реальной веб-разработки.
Современные модели демонстрируют высокие результаты в написании отдельных компонентов, но часто ошибаются при интеграции кода в полноценные проекты. Статические метрики, такие как BLEU или CodeBLEU, не способны оценить, будет ли сгенерированный проект корректно работать в браузере, поддерживать интерактивность и соответствовать современным стандартам верстки. Новый подход переносит фокус с текстового сходства на проверку работоспособности кода в «открытом мире».
Методология бенчмарка предполагает использование динамических сред, где сгенерированный код исполняется и тестируется на соответствие пользовательским сценариям. Это позволяет учитывать вариативность реализации: одна и та же задача может быть решена разными способами, и каждый из них может быть признан валидным, если он достигает целевого функционала. Такой подход критически важен для оценки инструментов автоматизации разработки, которые должны справляться с постоянно меняющимися требованиями фронтенд-экосистемы.
Ключевые факты
- LiveEvalBench фокусируется на интерактивной оценке веб-артефактов вместо статического анализа кода.
- Бенчмарк учитывает вариативность решений, признавая допустимыми разные способы реализации одной задачи.
- Тестирование проводится в реальных браузерных средах для проверки исполнения кода и интерактивности.
- Система разработана для решения проблемы устаревания статических тестов в условиях быстрого развития фронтенд-технологий.