Исследователи представили VEHBench — специализированный диагностический бенчмарк для оценки эффективности LLM при проектировании вибрационных сборщиков энергии (VEH). В отличие от существующих тестов, фокусирующихся только на финальном результате, VEHBench анализирует работу моделей на каждом этапе инженерного цикла, учитывая сложные физические ограничения, что критически важно для создания автономных IoT-устройств без батарейного питания.

Процесс разработки устройств для сбора энергии требует итеративного подхода и соблюдения строгих физических параметров. Использование LLM в качестве интерфейса для инженерных рабочих процессов сталкивается с проблемой «черного ящика»: текущие инструменты не позволяют понять, на каком именно этапе проектирования модель допускает ошибку. Новый бенчмарк разбивает процесс на логические стадии, позволяя детально отследить точность расчетов и соблюдение технических требований на каждом шаге.

Внедрение подобных узкоспециализированных тестов помогает лучше понять возможности генеративных моделей в прикладных инженерных задачах. Это позволяет разработчикам точнее настраивать промпты и архитектуры агентов для работы со сложными физическими системами, где цена ошибки при проектировании крайне высока.

Ключевые факты

  • VEHBench разработан для оценки LLM в контексте проектирования вибрационных сборщиков энергии (VEH).
  • Бенчмарк фокусируется на поэтапной диагностике, а не только на проверке итогового инженерного артефакта.
  • Инструмент учитывает связанные физические ограничения, характерные для создания IoT-устройств без внешних источников питания.
  • Методология позволяет выявлять слабые места в логике моделей на промежуточных стадиях инженерного проектирования.