Исследователи проанализировали динамику публикаций на платформе arXiv и обнаружили, что доля научных работ с характерными лингвистическими паттернами ИИ-генерации превысила 30%. Анализ охватил миллионы текстов, выявив резкий рост использования LLM в академической среде. Это ставит под вопрос качество научной фильтрации и требует пересмотра подходов к верификации контента в академических репозиториях.
Авторы исследования использовали статистические методы для выявления специфических лексических конструкций, которые часто встречаются в текстах, созданных моделями вроде GPT-4. Исследование показывает, что использование ИИ-инструментов для написания черновиков, редактирования и перефразирования стало повсеместным в различных дисциплинах, от компьютерных наук до физики. Рост доли таких текстов коррелирует с доступностью инструментов для генерации контента.
Подобная тенденция создает риски для научной достоверности, так как автоматизированные системы могут генерировать правдоподобные, но фактически неверные или «галлюцинирующие» утверждения. Это вынуждает научное сообщество задумываться о внедрении новых стандартов проверки оригинальности работ, которые выходят за рамки традиционных антиплагиат-систем, ориентированных на поиск прямого копирования текста.
Ключевые факты
- Доля публикаций на arXiv с признаками ИИ-генерации превысила порог в 30% в 2024 году.
- В качестве индикаторов использовались специфические лингвистические маркеры, характерные для моделей семейства GPT.
- Рост использования ИИ-инструментов наблюдается во всех категориях научных публикаций, представленных на платформе.
- Исследование подчеркивает необходимость разработки новых инструментов для верификации авторства в академической среде.