Исследователи представили метод Fully Inductive Cardinality Estimation для оптимизации SPARQL-запросов в графах знаний. В отличие от существующих моделей, которые требуют переобучения при изменении структуры графа, новый подход позволяет эффективно оценивать количество результатов без привязки к конкретным данным, что значительно упрощает интеграцию нейросетевых оценщиков в реальные системы управления базами данных.
Традиционные методы оценки кардинальности, основанные на статистике или сэмплировании, часто проигрывают в точности современным ML-решениям. Однако последние до сих пор были трансдуктивными: они жестко привязаны к графу, на котором обучались. При добавлении новых узлов или связей такие модели теряли актуальность, что делало их использование в динамических triplestore-системах практически невозможным.
Предложенный подход решает проблему индуктивности, позволяя модели обобщать знания о структуре графа независимо от его текущего состояния. Это открывает путь к внедрению глубокого обучения в движки оптимизации запросов, где точность оценки кардинальности напрямую влияет на выбор плана выполнения и общую производительность обработки сложных графовых паттернов.
Ключевые факты
- Метод ориентирован на оптимизацию Basic Graph Patterns (BGP) в SPARQL-запросах.
- Решение устраняет необходимость в дорогостоящем переобучении модели при обновлении графа знаний.
- Подход превосходит классические статистические методы и сэмплирование по точности прогнозирования.
- Технология адаптирована для работы в реальных triplestore-системах, где структура данных постоянно меняется.