Исследователи представили ExtractBench — специализированный бенчмарк для оценки качества работы ИИ-агентов при извлечении структурированных данных из корпоративных документов. Инструмент фокусируется на точности значений и полноте записей в соответствии с заданными схемами, обеспечивая проверку способности моделей подтверждать извлеченную информацию ссылками на исходные фрагменты текста, что критически важно для автоматизации бизнес-процессов.

Современные корпоративные системы все чаще полагаются на агентные решения для обработки неструктурированных данных, таких как счета, контракты и технические отчеты. Однако существующие метрики часто не учитывают специфику бизнес-задач, где критически важна не только точность распознавания, но и строгое соблюдение заданной пользователем схемы данных. ExtractBench заполняет этот пробел, предлагая комплексный подход к оценке надежности моделей в условиях реальных корпоративных рабочих процессов.

Бенчмарк позволяет количественно измерить, насколько эффективно модель справляется с извлечением сложных иерархических структур и как часто она допускает «галлюцинации» при отсутствии данных в исходном документе. Использование этого инструмента помогает разработчикам систем автоматизации лучше понимать ограничения LLM и настраивать пайплайны обработки данных для достижения высокой точности в задачах RAG и агентного извлечения информации.

Ключевые факты

  • ExtractBench является первым бенчмарком, который комплексно оценивает точность значений и полноту записей при масштабном извлечении данных.
  • Основной упор сделан на проверку «обоснованности» (grounding) — способности модели подтверждать каждый извлеченный элемент ссылкой на конкретный фрагмент документа.
  • Методология бенчмарка ориентирована на schema-guided extraction, где агент должен строго следовать заданному пользователем шаблону данных.
  • Инструмент предназначен для оценки производительности моделей в корпоративных сценариях, требующих высокой степени достоверности и минимизации ошибок при обработке документов.