Исследователи проанализировали эффективность коллективного интеллекта в системах из нескольких LLM. Выяснилось, что внешнее разнообразие аргументов агентов часто является иллюзорным: модели могут генерировать разные доводы, сохраняя при этом идентичные выводы. Это нарушает принцип эпистемической ревизии, при котором расхождения во мнениях должны приводить к обновлению коллективного знания и исправлению ошибок в процессе дискуссии.

Авторы работы предложили метрику «связи дисперсии и ревизии» (dispersion-revision coupling), которая позволяет оценить, насколько реально группа агентов способна менять позицию под воздействием новой информации. В ходе экспериментов с «черными ящиками» выяснилось, что даже при высокой вариативности ответов агенты часто демонстрируют когнитивную ригидность. Это ставит под сомнение надежность существующих методов многоагентного взаимодействия, где разнообразие мнений используется как гарант качества итогового решения.

Проблема заключается в том, что текущие архитектуры агентных систем часто имитируют процесс дебатов, не обладая при этом механизмом глубокой переработки аргументации. Если агенты не способны конвертировать разногласия в качественный пересмотр своих внутренних состояний, коллективная работа превращается в формальную генерацию текста без реального повышения точности или критического анализа данных.

Ключевые факты

  • Введено понятие «связи дисперсии и ревизии» для диагностики способности ИИ-групп к самокоррекции.
  • Установлено, что разнообразие аргументов в LLM-коллективах не всегда коррелирует с готовностью моделей менять исходные выводы.
  • Исследование фокусируется на «черных ящиках», что позволяет применять диагностику к любым проприетарным моделям без доступа к их весам.
  • Выявлено, что текущие многоагентные системы склонны к сохранению консенсуса даже при наличии противоречивых входных данных, что снижает эффективность коллективного принятия решений.