Исследователи предложили альтернативу стандартному методу RAG, основанному на поиске Top-K ближайших соседей. Для работы с финансовой и регуляторной документацией авторы разработали агентный подход, заменяющий «черный ящик» векторного поиска на интерпретируемые операции. Новый метод позволяет точнее извлекать данные из длинных отчетов, где семантическая близость чанков часто не гарантирует полноту и точность ответа.

Традиционная архитектура RAG, использующая нарезку текста на фрагменты и их последующую векторизацию, часто оказывается неэффективной для структурированных документов. В таких материалах, как аудиторские отчеты или финансовые выписки, ключевая информация распределена по разным разделам и требует логического связывания, а не простого сопоставления векторов. Агентные операции позволяют модели выполнять многошаговый поиск, имитируя работу аналитика, который последовательно изучает оглавление, таблицы и специфические разделы.

Внедрение агентного поиска вместо классического Top-K повышает прозрачность системы, позволяя отслеживать цепочку рассуждений при извлечении данных. Это критически важно для областей, где цена ошибки высока, а интерпретируемость результатов является обязательным требованием регуляторов. Метод демонстрирует значительное преимущество в задачах, требующих синтеза информации из разрозненных частей документа, которые стандартные алгоритмы поиска часто игнорируют.

Ключевые факты

  • Стандартный метод Top-K признан структурно несостоятельным для сложных документов: финансовых отчетов, аудиторских заключений и регуляторных сводок.
  • Предложенный подход заменяет векторный поиск на интерпретируемые агентные операции, обеспечивающие логическую связность извлечения.
  • Исследование проводилось на примере правительственного финансового отчета объемом 780 страниц.
  • Агентный метод позволяет модели выполнять многошаговые запросы, имитируя аналитический процесс поиска информации в структурированных данных.