Исследование показало критическое снижение эффективности современных больших языковых моделей при решении задач, требующих последовательных рассуждений в разных предметных областях. Если в простых сценариях точность моделей достигает 83%, то при необходимости связывать знания из нескольких доменов показатель падает до 43%. Это подчеркивает фундаментальные ограничения текущих архитектур в задачах многошагового логического вывода.

Авторы работы проанализировали поведение ведущих frontier-моделей, сталкивая их с задачами, где требуется не просто извлечение информации, а синтез знаний из различных дисциплин. Выяснилось, что при увеличении глубины цепочки рассуждений (chain-of-thought) модели начинают чаще допускать логические ошибки, терять контекст или галлюцинировать, что делает их менее надежными для сложных агентных систем, требующих кросс-доменной экспертизы.

Результаты указывают на то, что текущие методы обучения и дообучения моделей недостаточно эффективно развивают способность к обобщению логических структур. Вместо глубокого понимания взаимосвязей между областями знаний, модели часто полагаются на статистические закономерности, которые перестают работать при выходе за рамки узких сценариев. Это создает барьер для внедрения ИИ в процессы, требующие комплексного анализа и принятия решений в условиях неопределенности.

Ключевые факты

  • Точность ответов топовых LLM снижается с 83% до 43% при переходе от однодоменных к многодоменным задачам.
  • Основная причина деградации — неспособность моделей поддерживать логическую связность при необходимости объединения знаний из разных областей.
  • Исследование подтверждает, что текущие методы цепочечных рассуждений (CoT) имеют предел масштабируемости при усложнении структуры задачи.
  • Выявленная проблема критична для разработки автономных агентов, выполняющих многоэтапные бизнес-процессы.