Исследователи представили LiveEvalBench — новый бенчмарк для оценки способности LLM создавать интерактивные веб-приложения. В отличие от статических тестов, которые проверяют код на соответствие фиксированным шаблонам, LiveEvalBench учитывает динамическую природу фронтенда. Система оценивает функциональность и корректность сгенерированных артефактов в реальных браузерных средах, что позволяет точнее измерять пригодность моделей для реальной веб-разработки.

Современные модели демонстрируют высокие результаты в написании отдельных компонентов, но часто ошибаются при интеграции кода в полноценные проекты. Статические метрики, такие как BLEU или CodeBLEU, не способны оценить, будет ли сгенерированный проект корректно работать в браузере, поддерживать интерактивность и соответствовать современным стандартам верстки. Новый подход переносит фокус с текстового сходства на проверку работоспособности кода в «открытом мире».

Методология бенчмарка предполагает использование динамических сред, где сгенерированный код исполняется и тестируется на соответствие пользовательским сценариям. Это позволяет учитывать вариативность реализации: одна и та же задача может быть решена разными способами, и каждый из них может быть признан валидным, если он достигает целевого функционала. Такой подход критически важен для оценки инструментов автоматизации разработки, которые должны справляться с постоянно меняющимися требованиями фронтенд-экосистемы.

Ключевые факты

  • LiveEvalBench фокусируется на интерактивной оценке веб-артефактов вместо статического анализа кода.
  • Бенчмарк учитывает вариативность решений, признавая допустимыми разные способы реализации одной задачи.
  • Тестирование проводится в реальных браузерных средах для проверки исполнения кода и интерактивности.
  • Система разработана для решения проблемы устаревания статических тестов в условиях быстрого развития фронтенд-технологий.