Исследователи проанализировали динамику публикаций на платформе arXiv и обнаружили, что доля научных работ с характерными лингвистическими паттернами ИИ-генерации превысила 30%. Анализ охватил миллионы текстов, выявив резкий рост использования LLM в академической среде. Это ставит под вопрос качество научной фильтрации и требует пересмотра подходов к верификации контента в академических репозиториях.

Авторы исследования использовали статистические методы для выявления специфических лексических конструкций, которые часто встречаются в текстах, созданных моделями вроде GPT-4. Исследование показывает, что использование ИИ-инструментов для написания черновиков, редактирования и перефразирования стало повсеместным в различных дисциплинах, от компьютерных наук до физики. Рост доли таких текстов коррелирует с доступностью инструментов для генерации контента.

Подобная тенденция создает риски для научной достоверности, так как автоматизированные системы могут генерировать правдоподобные, но фактически неверные или «галлюцинирующие» утверждения. Это вынуждает научное сообщество задумываться о внедрении новых стандартов проверки оригинальности работ, которые выходят за рамки традиционных антиплагиат-систем, ориентированных на поиск прямого копирования текста.

Ключевые факты

  • Доля публикаций на arXiv с признаками ИИ-генерации превысила порог в 30% в 2024 году.
  • В качестве индикаторов использовались специфические лингвистические маркеры, характерные для моделей семейства GPT.
  • Рост использования ИИ-инструментов наблюдается во всех категориях научных публикаций, представленных на платформе.
  • Исследование подчеркивает необходимость разработки новых инструментов для верификации авторства в академической среде.