Исследовательский проект Preseason проанализировал, какие инструменты разработки показывают лучшие результаты при автоматизированном создании веб-приложений с помощью LLM. Авторы протестировали связки различных фреймворков и библиотек, чтобы определить, какие из них наиболее устойчивы к ошибкам планирования и генерации кода, когда агент берет на себя роль полноценного архитектора и разработчика программного обеспечения.

В ходе тестирования оценивалась способность моделей не просто писать отдельные функции, а выстраивать связную структуру приложения, управлять зависимостями и обеспечивать работоспособность фронтенда и бэкенда. Исследование фокусируется на выявлении паттернов, которые позволяют минимизировать количество «галлюцинаций» и логических разрывов в коде, создаваемом нейросетями в условиях реальных задач по разработке ПО.

Результаты показывают, что выбор стека технологий критически влияет на успех агентной разработки. Некоторые современные инструменты оказались более «дружелюбными» к LLM благодаря предсказуемой структуре API и качественной документации, что позволяет агентам быстрее адаптироваться к изменениям и эффективнее исправлять возникающие ошибки в процессе итеративной сборки проекта.

Ключевые факты

  • Исследование сфокусировано на оценке производительности LLM при создании полноценных веб-приложений, а не отдельных фрагментов кода.
  • Проект Preseason анализирует совместимость различных инструментов разработки с агентными рабочими процессами.
  • Основной упор сделан на устойчивость архитектурных решений, принимаемых ИИ в процессе написания кода.
  • Выявлена прямая зависимость между предсказуемостью API инструментов и успешностью выполнения задач агентами.