Исследователи представили новый подход к обнаружению противоречий в данных между различными модальностями: текстом, таблицами и графами знаний. В условиях, когда Wikipedia и Wikidata служат фундаментом для обучения LLM и RAG-систем, рассогласование информации в этих источниках критически влияет на точность генерации. Разработанный метод позволяет автоматически находить и объяснять конфликты, повышая надежность данных для ИИ-моделей.
Проблема мультимодальной несогласованности возникает из-за того, что знания в крупных базах данных часто распределены по разным форматам. Когда текстовое описание объекта противоречит данным в таблице или связям в графе, системы RAG могут выдавать галлюцинации или неверные факты. Новое исследование предлагает алгоритмическое решение для верификации консистентности, что особенно важно для задач, требующих высокой точности, таких как корпоративная аналитика или автоматизированная проверка фактов.
Предложенный подход фокусируется на выявлении «модально-уровневых» противоречий. Вместо того чтобы полагаться на одну форму представления данных, система сопоставляет семантические сущности и их атрибуты во всех доступных источниках. Это позволяет не только фиксировать факт расхождения, но и предоставлять интерпретируемое обоснование того, какая часть данных является спорной, что упрощает процесс очистки и подготовки датасетов для обучения моделей.
Ключевые факты
- Исследование направлено на решение проблемы противоречий между неструктурированным текстом, табличными данными и структурированными графами знаний.
- Метод ориентирован на повышение качества данных, используемых при предварительном обучении LLM и в архитектурах RAG.
- Система автоматически детектирует и объясняет конфликты, возникающие при кросс-модальном сопоставлении информации из Wikipedia и Wikidata.
- Разработка позволяет снизить риск генерации недостоверных данных за счет верификации консистентности на этапе подготовки обучающей выборки или в процессе поиска контекста.