Исследователи проанализировали, как четыре ведущих семейства LLM (Claude, Grok, GPT, Gemini) оценивают псевдонаучные концепции в период с октября 2025 по февраль 2026 года. Результаты показали, что модели демонстрируют нестабильное и непрозрачное поведение при проверке спорных утверждений, а их ответы существенно зависят от конфигурации развертывания и способа взаимодействия с пользователем через API или веб-интерфейс.

Работа фокусируется на том, как коммерческие системы, используемые в качестве справочных источников знаний, справляются с фильтрацией и валидацией информации, основанной на биосоциальных теориях Фрэнка Солтера. Авторы подчеркивают, что отсутствие единых стандартов в настройках безопасности и системных промптах приводит к тому, что одна и та же модель может выдавать разные вердикты в зависимости от времени запроса и технического контекста.

Данное исследование поднимает вопрос о надежности ИИ как инструмента для верификации фактов. Непрозрачность процессов «эпистемического посредничества» в моделях затрудняет предсказание того, как система отреагирует на дискуссионные темы, что создает риски при использовании LLM в образовательных или аналитических целях, где требуется высокая точность и нейтральность аргументации.

Ключевые факты

  • В исследовании протестированы четыре семейства моделей: Claude, Grok, GPT и Gemini.
  • Период наблюдений охватил временной интервал с октября 2025 года по февраль 2026 года.
  • Анализировалась реакция моделей на этнонационалистическую псевдонауку, основанную на биосоциальной модели Фрэнка Солтера.
  • Выявлена значительная вариативность ответов в зависимости от способа доступа (API против веб-интерфейса) и времени совершения запроса.
  • Установлено, что конфигурации развертывания напрямую влияют на то, как модель классифицирует спорные научные утверждения.