Проект ML-pokedex исследует альтернативные методы обучения моделей, используя данные в формате RDF (Resource Description Framework) вместо традиционных текстовых корпусов. Автор тестирует возможность прямой подачи структурированных семантических данных в архитектуры нейронных сетей, чтобы оценить, насколько эффективно модели могут усваивать графовые связи и логические отношения без предварительной конвертации в естественный язык.

Традиционные LLM обучаются на линейных последовательностях токенов, что часто приводит к потере строгих логических связей, заложенных в базах знаний. Использование RDF позволяет сохранить структуру «субъект-предикат-объект», что потенциально упрощает извлечение фактов и снижает вероятность галлюцинаций. В рамках экспериментов проверяется, могут ли модели обучаться на таких графах напрямую, сохраняя при этом способность к обобщению.

Этот подход затрагивает фундаментальную проблему представления знаний в ИИ. Если обучение на графах окажется масштабируемым, это откроет путь к созданию более точных систем, работающих с экспертными данными, где точность связей важнее вероятностного предсказания следующего слова. Проект носит исследовательский характер и фокусируется на поиске оптимальных способов токенизации графовых структур для современных трансформеров.

Ключевые факты

  • Проект изучает возможность обучения моделей на RDF-триплетах без промежуточного преобразования в текст.
  • Основная цель — сохранение строгой логической структуры данных при обучении нейронных сетей.
  • Эксперименты направлены на решение проблемы галлюцинаций за счет использования семантических связей.
  • Исследование доступно в формате открытого репозитория с описанием методологии и промежуточных результатов.