Опубликованы результаты тестирования современных языковых моделей в написании кода для игрового движка Godot. Исследование оценивает способность ИИ генерировать рабочий код на GDScript, сравнивая производительность моделей Sol, K3 и Fable. Результаты показывают значительные различия в качестве синтаксиса и логической корректности решений, предлагаемых каждой из моделей при решении типовых задач разработки.
Бенчмарк сфокусирован на специфике игрового программирования, где критически важны не только алгоритмическая точность, но и понимание архитектуры узлов (nodes) и сигналов движка Godot. Авторы исследования проанализировали, как модели справляются с написанием скриптов для управления персонажами, обработки ввода и взаимодействия объектов, выявляя, какая из них допускает меньше всего ошибок, требующих ручной правки.
Данный тест подчеркивает растущую специализацию LLM в узких технических доменах. В то время как общие модели показывают хорошие результаты в стандартных языках программирования, их эффективность в специфических игровых фреймворках может существенно варьироваться, что делает подобные бенчмарки важным инструментом для выбора подходящего ассистента в геймдеве.
Ключевые факты
- Модель Sol продемонстрировала лучшие показатели точности кода среди протестированных решений.
- Второе место в рейтинге заняла модель K3, показав стабильные результаты в базовых задачах.
- Модель Fable замкнула тройку лидеров, уступив конкурентам в сложности генерируемых структур.
- Тестирование проводилось исключительно на задачах, связанных с написанием скриптов на GDScript для движка Godot.
- Основным критерием оценки стала работоспособность кода без необходимости внесения правок разработчиком.