Ассоциация вычислительной техники (ACM) призывает открыть доступ к своей цифровой библиотеке для обучения и RAG-систем больших языковых моделей. Авторы инициативы утверждают, что интеграция верифицированного научного контента в ИИ-инструменты критически важна для повышения точности ответов, борьбы с галлюцинациями и обеспечения исследователей надежной базой знаний в области компьютерных наук.

На текущий момент доступ к качественным научным публикациям ограничен из-за жестких лицензионных барьеров и платных подписок. Это создает ситуацию, когда модели обучаются на менее достоверных источниках, что снижает их ценность для профессионального сообщества. Открытие архивов ACM позволит разработчикам создавать специализированные системы, способные цитировать первоисточники и предоставлять глубокую аналитику, основанную на рецензируемых данных.

Реализация этого предложения требует разработки новых моделей лицензирования, которые защитят авторские права, но при этом позволят использовать контент для индексации и генерации ответов. Это может стать прецедентом для других академических издательств, стремящихся адаптировать свои архивы к эпохе генеративного ИИ и сохранить актуальность научных знаний в цифровой среде.

Ключевые факты

  • ACM Digital Library содержит более 600 000 полнотекстовых статей и материалов конференций по компьютерным наукам.
  • Основная цель инициативы — минимизация галлюцинаций в LLM за счет использования проверенных академических источников.
  • Предлагается внедрение API-доступа для RAG-систем, что позволит моделям ссылаться на конкретные публикации с подтвержденным авторством.
  • Ассоциация рассматривает создание гибридных моделей доступа, сочетающих открытые данные и платные подписки для корпоративных пользователей ИИ.