Исследователи SAP представили метрику Round-Trip Correctness для оценки точности генеративных моделей при моделировании бизнес-процессов. Метод проверяет способность ИИ не только генерировать корректные схемы процессов, но и воспроизводить исходные данные после их трансформации в код или нотацию. Это позволяет измерить надежность ИИ-систем в задачах автоматизации корпоративных рабочих потоков, где критически важна целостность данных.
Традиционные метрики, такие как BLEU или ROUGE, часто не учитывают семантическую структуру бизнес-логики, фокусируясь лишь на сходстве текста. Новый подход оценивает «цикл» преобразования: модель переводит описание процесса в формальную нотацию (например, BPMN), а затем обратно в текстовое описание. Если итоговый результат совпадает с исходным по смыслу и логике, модель считается точной.
Такой подход решает проблему галлюцинаций в сложных корпоративных сценариях, где даже незначительное отклонение в логике процесса может привести к ошибкам в автоматизации. Метрика позволяет разработчикам точнее настраивать LLM для работы с ERP-системами и сложными регламентами, минимизируя риски при внедрении генеративных инструментов в критически важные бизнес-операции.
Ключевые факты
- Метрика Round-Trip Correctness фокусируется на семантической эквивалентности между исходным описанием и результатом обратного преобразования.
- Метод предназначен для оценки моделей, работающих с формальными языками и нотациями бизнес-процессов, такими как BPMN.
- Подход позволяет выявлять скрытые логические ошибки, которые пропускают стандартные метрики оценки текста.
- Разработка направлена на повышение надежности ИИ-агентов, интегрированных в корпоративные системы управления ресурсами предприятия (ERP).