Исследователи протестировали шесть актуальных LLM, предложив им спроектировать 100 различных программных систем. Эксперимент показал значительные различия в качестве архитектурных решений, выборе стека технологий и способности моделей следовать сложным техническим требованиям. Результаты подчеркивают текущие возможности и ограничения генеративного ИИ при автоматизации этапа системного проектирования в жизненном цикле разработки программного обеспечения.
В ходе тестирования оценивались такие параметры, как логическая связность компонентов, масштабируемость предложенных решений и обоснованность выбора инструментов. Модели продемонстрировали разный уровень «галлюцинаций» при работе с редкими библиотеками и фреймворками, а также неодинаковую склонность к выбору популярных, но не всегда подходящих для конкретной задачи технологий. Это исследование дает представление о том, насколько эффективно современные модели справляются с высокоуровневым проектированием, требующим учета множества взаимосвязанных ограничений.
Анализ показал, что выбор модели напрямую влияет на надежность архитектурного плана. В то время как одни модели отдают предпочтение проверенным временем решениям, другие чаще предлагают экспериментальные или избыточные стеки. Полученные данные помогают лучше понять, какие задачи проектирования уже можно делегировать ИИ, а где по-прежнему необходим строгий контроль со стороны инженеров-архитекторов.
Ключевые факты
- В тестировании приняли участие 6 различных LLM, включая ведущие проприетарные и открытые модели.
- Общий объем выборки составил 100 уникальных сценариев проектирования программных систем.
- Оценка проводилась по критериям технической обоснованности, полноты стека и соответствия бизнес-требованиям.
- Выявлена корреляция между размером контекстного окна модели и глубиной проработки архитектурных связей в сложных системах.