Исследователи представили DenseOn и LateOn — полностью открытые модели для семантического поиска, решающие проблему зависимости индустрии от закрытых данных. Авторы разработали комплексный пайплайн обучения, включающий 665 млн пар данных, и продемонстрировали эффективность переноса англоязычного обучения на многоязычные задачи, обеспечивая высокую точность в поиске по коду и длинным документам при полной воспроизводимости результатов.

Современные системы поиска (retrieval) часто опираются на проприетарные датасеты, что затрудняет независимую проверку и развитие технологий. Новый подход предлагает прозрачный рецепт создания моделей, начиная от фильтрации 1,4 млрд пар данных из 34 публичных источников до этапов контрастивного обучения. Это позволяет разработчикам создавать высокопроизводительные поисковые движки без необходимости полагаться на «черные ящики» крупных корпораций.

Особое внимание в работе уделено архитектуре Late-Interaction, которая позволяет эффективно обрабатывать длинные контексты и сложные запросы, характерные для программирования и многоязычной документации. Использование метода translate-train для адаптации моделей показало, что качественные англоязычные данные могут успешно масштабироваться на другие языки, сохраняя при этом низкую задержку и высокую релевантность выдачи.

Ключевые факты

  • Датасет для обучения сформирован из 665 млн контрастивных пар, отобранных из 1,4 млрд доступных записей.
  • Обучение охватывает 34 публичных источника данных, обеспечивая полную воспроизводимость процесса.
  • Модели оптимизированы для работы с длинным контекстом и специализированными задачами, такими как поиск по исходному коду.
  • Предложенный метод демонстрирует успешный перенос знаний (transfer learning) с английского языка на многоязычные сценарии через технику translate-train.