Исследование выявило критические сбои при попытке объединить четыре различные языковые модели для автоматизации задач в терминале через Claude Code. В ходе тестирования на бенчмарке Terminal-Bench выяснилось, что использование нескольких моделей в связке приводит к непредсказуемому поведению, отказам в выполнении команд и ошибкам в логике управления средой, что ставит под сомнение эффективность сложных агентных цепочек.
Основная проблема заключается в конфликтах между моделями при интерпретации контекста терминала и передаче управления. Даже при использовании продвинутых инструментов оркестрации, модели часто «спорят» друг с другом или зацикливаются, пытаясь исправить ошибки, которые сами же и создали. Это приводит к деградации производительности по сравнению с использованием одной, более мощной модели, способной удерживать контекст всей сессии целиком.
Результаты эксперимента подчеркивают сложности, возникающие при попытке масштабировать агентные системы через простое соединение нескольких LLM. Вместо повышения точности, такая архитектура часто увеличивает количество галлюцинаций и задержек, так как каждая модель в цепочке вносит свои искажения в интерпретацию системных вызовов и командной строки.
Ключевые факты
- Тестирование проводилось с использованием четырех различных моделей в рамках среды Claude Code.
- В качестве эталона для оценки агентных способностей применялся бенчмарк Terminal-Bench.
- Выявлено четыре типа критических сбоев, включая отказ от выполнения команд и логические циклы.
- Использование нескольких моделей в связке показало худшие результаты по сравнению с одиночными моделями в задачах управления терминалом.
- Основная причина неудач — несовместимость контекстных представлений моделей при работе с динамической средой исполнения.