Новое исследование, опубликованное в PhilSci-Archive, ставит под сомнение способность больших языковых моделей (LLM) к полноценному логическому выводу и планированию. Авторы доказывают, что текущие архитектуры, основанные на предсказании следующего токена, не способны к «прыжкам» — переходу к новым концептуальным пространствам, требующим глубокого понимания причинно-следственных связей, оставаясь в рамках статистических закономерностей обучающих данных.
Работа анализирует фундаментальные ограничения моделей в задачах, требующих выхода за пределы аппроксимации функций. Исследователи утверждают, что даже при увеличении вычислительных мощностей и объемов обучающих выборок, модели сталкиваются с «логическим барьером». Это препятствует достижению уровня рассуждений, характерного для человеческого мышления, где критически важна способность к абстракции и пересмотру внутренних моделей мира в ответ на новые условия.
Авторы подчеркивают, что текущий прогресс в области ИИ во многом является результатом масштабирования, а не качественного прорыва в методах обработки информации. Без изменения подходов к архитектуре, ориентированных на символьные вычисления или гибридные системы, модели будут ограничены в выполнении задач, требующих долгосрочного планирования и адаптации к принципиально новым сценариям, выходящим за рамки их тренировочного опыта.
Ключевые факты
- Исследование опубликовано в архиве PhilSci-Archive под названием «LLMs Can't Jump».
- Основной тезис работы заключается в неспособности моделей к истинному логическому выводу вне статистических корреляций.
- Авторы указывают на фундаментальный разрыв между предсказанием следующего токена и способностью к абстрактному планированию.
- Работа ставит под сомнение эффективность стратегии масштабирования (scaling laws) для достижения полноценного когнитивного уровня ИИ.