Исследователи представили ExtractBench — специализированный бенчмарк для оценки качества работы ИИ-агентов при извлечении структурированных данных из корпоративных документов. Инструмент фокусируется на точности значений и полноте записей в соответствии с заданными схемами, обеспечивая проверку способности моделей подтверждать извлеченную информацию ссылками на исходные фрагменты текста, что критически важно для автоматизации бизнес-процессов.
Современные корпоративные системы все чаще полагаются на агентные решения для обработки неструктурированных данных, таких как счета, контракты и технические отчеты. Однако существующие метрики часто не учитывают специфику бизнес-задач, где критически важна не только точность распознавания, но и строгое соблюдение заданной пользователем схемы данных. ExtractBench заполняет этот пробел, предлагая комплексный подход к оценке надежности моделей в условиях реальных корпоративных рабочих процессов.
Бенчмарк позволяет количественно измерить, насколько эффективно модель справляется с извлечением сложных иерархических структур и как часто она допускает «галлюцинации» при отсутствии данных в исходном документе. Использование этого инструмента помогает разработчикам систем автоматизации лучше понимать ограничения LLM и настраивать пайплайны обработки данных для достижения высокой точности в задачах RAG и агентного извлечения информации.
Ключевые факты
- ExtractBench является первым бенчмарком, который комплексно оценивает точность значений и полноту записей при масштабном извлечении данных.
- Основной упор сделан на проверку «обоснованности» (grounding) — способности модели подтверждать каждый извлеченный элемент ссылкой на конкретный фрагмент документа.
- Методология бенчмарка ориентирована на schema-guided extraction, где агент должен строго следовать заданному пользователем шаблону данных.
- Инструмент предназначен для оценки производительности моделей в корпоративных сценариях, требующих высокой степени достоверности и минимизации ошибок при обработке документов.