Исследовательский проект Preseason проанализировал, какие инструменты разработки показывают лучшие результаты при автоматизированном создании веб-приложений с помощью LLM. Авторы протестировали связки различных фреймворков и библиотек, чтобы определить, какие из них наиболее устойчивы к ошибкам планирования и генерации кода, когда агент берет на себя роль полноценного архитектора и разработчика программного обеспечения.
В ходе тестирования оценивалась способность моделей не просто писать отдельные функции, а выстраивать связную структуру приложения, управлять зависимостями и обеспечивать работоспособность фронтенда и бэкенда. Исследование фокусируется на выявлении паттернов, которые позволяют минимизировать количество «галлюцинаций» и логических разрывов в коде, создаваемом нейросетями в условиях реальных задач по разработке ПО.
Результаты показывают, что выбор стека технологий критически влияет на успех агентной разработки. Некоторые современные инструменты оказались более «дружелюбными» к LLM благодаря предсказуемой структуре API и качественной документации, что позволяет агентам быстрее адаптироваться к изменениям и эффективнее исправлять возникающие ошибки в процессе итеративной сборки проекта.
Ключевые факты
- Исследование сфокусировано на оценке производительности LLM при создании полноценных веб-приложений, а не отдельных фрагментов кода.
- Проект Preseason анализирует совместимость различных инструментов разработки с агентными рабочими процессами.
- Основной упор сделан на устойчивость архитектурных решений, принимаемых ИИ в процессе написания кода.
- Выявлена прямая зависимость между предсказуемостью API инструментов и успешностью выполнения задач агентами.