Исследователи протестировали шесть актуальных LLM, предложив им спроектировать 100 различных программных систем. Эксперимент показал значительные различия в качестве архитектурных решений, выборе стека технологий и способности моделей следовать сложным техническим требованиям. Результаты подчеркивают текущие возможности и ограничения генеративного ИИ при автоматизации этапа системного проектирования в жизненном цикле разработки программного обеспечения.

В ходе тестирования оценивались такие параметры, как логическая связность компонентов, масштабируемость предложенных решений и обоснованность выбора инструментов. Модели продемонстрировали разный уровень «галлюцинаций» при работе с редкими библиотеками и фреймворками, а также неодинаковую склонность к выбору популярных, но не всегда подходящих для конкретной задачи технологий. Это исследование дает представление о том, насколько эффективно современные модели справляются с высокоуровневым проектированием, требующим учета множества взаимосвязанных ограничений.

Анализ показал, что выбор модели напрямую влияет на надежность архитектурного плана. В то время как одни модели отдают предпочтение проверенным временем решениям, другие чаще предлагают экспериментальные или избыточные стеки. Полученные данные помогают лучше понять, какие задачи проектирования уже можно делегировать ИИ, а где по-прежнему необходим строгий контроль со стороны инженеров-архитекторов.

Ключевые факты

  • В тестировании приняли участие 6 различных LLM, включая ведущие проприетарные и открытые модели.
  • Общий объем выборки составил 100 уникальных сценариев проектирования программных систем.
  • Оценка проводилась по критериям технической обоснованности, полноты стека и соответствия бизнес-требованиям.
  • Выявлена корреляция между размером контекстного окна модели и глубиной проработки архитектурных связей в сложных системах.