Исследователи выявили критическую уязвимость в системах ИИ, используемых для автоматизированного рецензирования научных рукописей. Злоумышленники могут внедрять в текст скрытые инструкции (промпты), которые заставляют языковые модели игнорировать реальное содержание статьи и выдавать предвзятые или положительные оценки. Это создает серьезные риски для академической целостности и доверия к научным публикациям, проходящим через автоматизированную проверку.

Проблема заключается в том, что модели, анализирующие текст, не всегда способны отличить основной контент от вредоносных команд, спрятанных в сносках, метаданных или белом тексте. Такие «инъекции» могут манипулировать тоном рецензии, заставляя ИИ-ассистента игнорировать методологические ошибки или отсутствие данных. В условиях массового внедрения ИИ-инструментов в издательские процессы, подобные атаки становятся новым вектором угрозы для научной коммуникации.

Эксперты подчеркивают, что текущие методы фильтрации входящих данных в LLM недостаточны для защиты от сложных атак типа prompt injection в специфических контекстах. Издательствам необходимо пересмотреть подходы к безопасности при интеграции ИИ, внедряя многоуровневую проверку и ограничивая доступ моделей к исполнению инструкций, содержащихся непосредственно в анализируемых документах.

Ключевые факты

  • Уязвимость позволяет внедрять скрытые команды, которые перехватывают управление процессом оценки рукописи.
  • Атаки используют методы «невидимого текста» или специфического форматирования, которые считываются моделью, но не видны человеку-рецензенту.
  • Основной риск заключается в подмене критического анализа на сгенерированный ИИ положительный отзыв, что искажает процесс научного рецензирования.
  • Исследование указывает на необходимость разработки специализированных систем защиты от prompt injection для академических и корпоративных инструментов анализа документов.