Исследователи представили BenchCAD — специализированный набор тестов для оценки способностей LLM в области автоматизированного проектирования (CAD). В ходе тестирования новые модели продемонстрировали значительный прогресс, превзойдя показатели предыдущих лидеров, таких как Opus и Mythos 5, в задачах генерации и оптимизации инженерных чертежей и 3D-моделей, достигнув новых высот в точности исполнения сложных технических спецификаций.
Традиционные бенчмарки часто фокусируются на текстовых или программных задачах, упуская специфику инженерного ПО, где критически важны геометрическая точность и соблюдение стандартов проектирования. BenchCAD заполняет этот пробел, предлагая стандартизированную среду для проверки того, как модели справляются с параметрическим моделированием и интерпретацией инженерных ограничений.
Результаты показывают, что современные архитектуры моделей начинают эффективно справляться с задачами, которые ранее требовали глубокой интеграции с внешними CAD-движками. Это открывает путь к созданию автономных ИИ-ассистентов, способных не просто писать код, но и полноценно участвовать в процессах промышленного дизайна и инженерной подготовки производства.
Ключевые факты
- BenchCAD включает набор задач по генерации и редактированию 3D-геометрии и технических чертежей.
- Новые модели (включая GPT 5.6 Sol) показали статистически значимое превосходство над Opus и Mythos 5 по метрикам точности и соответствия инженерным стандартам.
- Исследование опубликовано в препринте arXiv (2608.00799) и задает новый стандарт для оценки специализированных инженерных ИИ-систем.
- Бенчмарк позволяет оценивать способность моделей работать с параметрическими ограничениями, что является критическим навыком для автоматизации в CAD-средах.