Исследователи проанализировали, как четыре ведущих семейства LLM (Claude, Grok, GPT, Gemini) оценивают псевдонаучные концепции в период с октября 2025 по февраль 2026 года. Результаты показали, что модели демонстрируют нестабильное и непрозрачное поведение при проверке спорных утверждений, а их ответы существенно зависят от конфигурации развертывания и способа взаимодействия с пользователем через API или веб-интерфейс.
Работа фокусируется на том, как коммерческие системы, используемые в качестве справочных источников знаний, справляются с фильтрацией и валидацией информации, основанной на биосоциальных теориях Фрэнка Солтера. Авторы подчеркивают, что отсутствие единых стандартов в настройках безопасности и системных промптах приводит к тому, что одна и та же модель может выдавать разные вердикты в зависимости от времени запроса и технического контекста.
Данное исследование поднимает вопрос о надежности ИИ как инструмента для верификации фактов. Непрозрачность процессов «эпистемического посредничества» в моделях затрудняет предсказание того, как система отреагирует на дискуссионные темы, что создает риски при использовании LLM в образовательных или аналитических целях, где требуется высокая точность и нейтральность аргументации.
Ключевые факты
- В исследовании протестированы четыре семейства моделей: Claude, Grok, GPT и Gemini.
- Период наблюдений охватил временной интервал с октября 2025 года по февраль 2026 года.
- Анализировалась реакция моделей на этнонационалистическую псевдонауку, основанную на биосоциальной модели Фрэнка Солтера.
- Выявлена значительная вариативность ответов в зависимости от способа доступа (API против веб-интерфейса) и времени совершения запроса.
- Установлено, что конфигурации развертывания напрямую влияют на то, как модель классифицирует спорные научные утверждения.