Исследователи представили GPTKB 2.0 — методологию для автоматического построения структурированных баз знаний непосредственно из больших языковых моделей. Решение устраняет ключевую проблему существующих подходов: отсутствие у LLM встроенного механизма идентификации сущностей, что ранее приводило к дублированию записей и путанице между объектами. Новый метод обеспечивает создание точных и очищенных от противоречий графов знаний.
Традиционные методы автоматизированного построения баз знаний (AKBC) часто сталкиваются с трудностями при извлечении фактов из неструктурированных данных. Использование LLM в качестве прямого источника знаний упрощает процесс, но требует инструментов для дедупликации и разрешения неоднозначностей. GPTKB 2.0 внедряет этап верификации и сопоставления сущностей, позволяя превращать вероятностные ответы моделей в строгие записи, пригодные для использования в корпоративных системах или поисковых движках.
Разработка направлена на повышение надежности RAG-систем и других приложений, требующих обращения к фактологическим данным. В отличие от стандартных методов генерации, где модель может выдавать противоречивые ответы, предложенный подход систематизирует информацию на этапе формирования базы, что минимизирует риск галлюцинаций при последующих запросах к данным.
Ключевые факты
- GPTKB 2.0 решает проблему отсутствия нативного представления сущностей в архитектуре LLM.
- Методология устраняет дубликаты и ошибки смешения сущностей, характерные для прямого извлечения знаний.
- Система позволяет преобразовывать неструктурированные выводы моделей в формализованные базы знаний.
- Подход ориентирован на повышение точности и фактологической достоверности в задачах автоматизированного построения баз знаний (AKBC).