Исследователи JuliaHub представили сравнительный анализ производительности передовых языковых моделей в задачах физического ИИ (Physical AI). В ходе тестирования оценивалась способность нейросетей решать инженерные и научные задачи, требующие понимания физических законов и работы с математическими моделями, что критически важно для автоматизации проектирования и моделирования сложных систем в промышленности.
В рамках исследования эксперты протестировали способность моделей генерировать корректный код для симуляций, интерпретировать физические параметры и интегрироваться с инструментами научного программирования. Основное внимание уделялось точности расчетов и минимизации галлюцинаций при работе с узкоспециализированными инженерными данными, где цена ошибки значительно выше, чем в задачах общего назначения.
Результаты показывают, что текущие frontier-модели демонстрируют разный уровень компетенций в зависимости от сложности физической модели. В то время как одни системы лучше справляются с написанием кода для численных методов, другие показывают более высокую точность в интерпретации физических констант и граничных условий, что определяет их пригодность для конкретных этапов R&D-цикла.
Ключевые факты
- Исследование сфокусировано на применимости LLM для моделирования физических процессов и инженерного проектирования.
- Оценка проводилась на основе способности моделей к генерации кода для специализированных научных библиотек и симуляторов.
- Анализ выявил существенные различия в точности моделей при работе с многофакторными физическими зависимостями.
- Тестирование подчеркивает необходимость специализированных бенчмарков для оценки «научной грамотности» ИИ-систем в промышленном секторе.