Исследователи представили PaDoc — метод параллельного декодирования с учетом макета для анализа документов. В отличие от стандартных авторегрессионных моделей, которые сериализуют контент в длинные последовательности, PaDoc позволяет обрабатывать независимые регионы документа одновременно. Это решение устраняет проблему избыточного времени генерации, сохраняя при этом целостный визуальный контекст страницы, что значительно повышает эффективность парсинга сложных документов.
Традиционные end-to-end парсеры сталкиваются с ограничением: длина последовательности растет пропорционально объему контента, что замедляет инференс. Двухэтапные подходы, основанные на нарезке документа (crop-based), обеспечивают параллелизм, но требуют многократного повторного кодирования визуальных данных и теряют глобальную структуру страницы. PaDoc решает этот конфликт, используя механизм «layout-grounded» декодирования, который синхронизирует параллельные потоки генерации с пространственным расположением элементов.
Данный подход позволяет сократить задержки при обработке многостраничных отчетов, таблиц и форм, где важно сохранять иерархию данных. Метод оптимизирует использование вычислительных ресурсов, минимизируя повторные вычисления визуальных признаков, что делает его перспективным для внедрения в системы автоматизации документооборота и извлечения структурированной информации из неструктурированных PDF-файлов.
Ключевые факты
- PaDoc использует стратегию параллельного декодирования, исключающую необходимость последовательной обработки каждого региона документа.
- Метод сохраняет глобальный визуальный контекст страницы, избегая фрагментации данных, характерной для двухэтапных моделей.
- Архитектура позволяет эффективно масштабировать процесс парсинга при увеличении количества контента на странице.
- Решение направлено на ускорение работы end-to-end систем анализа документов без потери точности извлечения информации.