Исследователи JuliaHub представили сравнительный анализ производительности передовых языковых моделей в задачах физического ИИ (Physical AI). В ходе тестирования оценивалась способность нейросетей решать инженерные и научные задачи, требующие понимания физических законов и работы с математическими моделями, что критически важно для автоматизации проектирования и моделирования сложных систем в промышленности.

В рамках исследования эксперты протестировали способность моделей генерировать корректный код для симуляций, интерпретировать физические параметры и интегрироваться с инструментами научного программирования. Основное внимание уделялось точности расчетов и минимизации галлюцинаций при работе с узкоспециализированными инженерными данными, где цена ошибки значительно выше, чем в задачах общего назначения.

Результаты показывают, что текущие frontier-модели демонстрируют разный уровень компетенций в зависимости от сложности физической модели. В то время как одни системы лучше справляются с написанием кода для численных методов, другие показывают более высокую точность в интерпретации физических констант и граничных условий, что определяет их пригодность для конкретных этапов R&D-цикла.

Ключевые факты

  • Исследование сфокусировано на применимости LLM для моделирования физических процессов и инженерного проектирования.
  • Оценка проводилась на основе способности моделей к генерации кода для специализированных научных библиотек и симуляторов.
  • Анализ выявил существенные различия в точности моделей при работе с многофакторными физическими зависимостями.
  • Тестирование подчеркивает необходимость специализированных бенчмарков для оценки «научной грамотности» ИИ-систем в промышленном секторе.