Исследователи представили метод атрибуции доказательств для моделей визуального понимания документов, который исключает необходимость использования координат или меток регионов. Вместо традиционного вывода ограничивающих рамок (bounding boxes), модель учится напрямую соотносить ответы с текстовыми и визуальными фрагментами документа, что значительно повышает точность интерпретации сложных данных и снижает вероятность ошибок при локализации информации.

Традиционные системы визуального понимания документов (VDU) часто полагаются на координатный интерфейс, требуя от модели предсказания точных границ объектов. Однако этот подход часто приводит к сбоям, когда модель понимает содержание, но не может корректно определить геометрические координаты. Новый подход переводит задачу в плоскость семантической связи, позволяя модели указывать на конкретные элементы документа без привязки к пиксельным сеткам.

Такой метод делает системы более устойчивыми к вариативности верстки и форматов документов, где стандартные методы детекции объектов показывают низкую эффективность. Это открывает путь к созданию более надежных инструментов для автоматизированной обработки счетов, контрактов и технических отчетов, где критически важна не только точность ответа, но и возможность проследить источник информации внутри исходного файла.

Ключевые факты

  • Новый метод устраняет зависимость от координат и меток регионов при поиске доказательств.
  • Модели обучаются прямой атрибуции ответов к фрагментам документа, повышая интерпретируемость результатов.
  • Подход решает проблему низкой точности VDU-систем при работе с документами сложной структуры.
  • Исследование направлено на повышение надежности автоматизированной обработки бизнес-документации.