Анализ возможностей современных ИИ-агентов показал, что они не способны эффективно проводить полноценные исследования с открытым финалом. Несмотря на успехи в выполнении конкретных задач, агенты сталкиваются с критическими трудностями при планировании долгосрочных стратегий, поиске информации в неструктурированных источниках и самостоятельной корректировке курса при возникновении неопределенности в процессе работы.

Исследователи протестировали ряд популярных агентных систем, имитируя условия реальной исследовательской деятельности. Основным барьером стала неспособность моделей поддерживать контекст на протяжении длительных итераций и склонность к «галлюцинациям» при попытке синтезировать данные из множества противоречивых источников. Агенты часто зацикливаются на неверных гипотезах, не имея механизмов для критической оценки промежуточных результатов.

Проблема усугубляется отсутствием надежных инструментов для верификации фактов в реальном времени. В отличие от узкоспециализированных задач, где агент действует по заданному алгоритму, открытый поиск требует высокого уровня абстракции и способности к метапознанию — качеств, которые пока отсутствуют в текущих архитектурах LLM. Это ограничивает применение автономных систем в аналитике, науке и стратегическом планировании.

Ключевые факты

  • Агенты демонстрируют высокую частоту ошибок при необходимости многоэтапного поиска и фильтрации релевантной информации.
  • Основным препятствием названа неспособность моделей к эффективному самоконтролю и пересмотру стратегии при получении негативных результатов.
  • Исследование подтвердило, что текущие системы склонны к преждевременной остановке работы, принимая неполные или ошибочные данные за окончательный ответ.
  • Авторы подчеркивают разрыв между способностью агентов писать код и их неспособностью проводить качественный аналитический поиск в неструктурированной среде.