Новое исследование анализирует применение языковых моделей для сопоставления сущностей (entity matching) — процесса идентификации записей, относящихся к одному и тому же объекту. Авторы работы систематизировали подходы, разделив влияние архитектурных решений, таких как bi-encoder, cross-encoder и генеративные модели, от факторов размера модели и методов предобучения, что позволяет точнее оценить применимость LLM в задачах интеграции данных.

Задача сопоставления сущностей критически важна для очистки данных и построения графов знаний, однако выбор оптимальной архитектуры часто затруднен из-за смешения переменных в экспериментах. Исследователи изолировали влияние архитектурных паттернов, чтобы понять, какой тип модели лучше справляется с выявлением дубликатов в разнородных наборах данных. Это помогает разработчикам систем обработки данных выбирать архитектуру, исходя из требований к точности и вычислительным ресурсам.

Работа предлагает методологию для оценки того, как именно предобучение и архитектура влияют на способность модели различать идентичные сущности в сложных сценариях. Результаты исследования позволяют более эффективно внедрять нейросетевые методы в пайплайны обработки данных, заменяя классические алгоритмы на базе правил или традиционного машинного обучения на более гибкие решения на базе трансформеров.

Ключевые факты

  • Исследование охватывает три основных архитектурных подхода: bi-encoder, cross-encoder и генеративные модели.
  • Работа направлена на устранение путаницы между влиянием размера модели, её предобучения и архитектурного дизайна в задачах Entity Matching.
  • Выявлено, что архитектурные различия оказывают существенное влияние на производительность, которое ранее часто ошибочно приписывалось исключительно масштабу модели.
  • Предложенная методология позволяет изолировать факторы, влияющие на точность сопоставления записей в реальных бизнес-системах.