Разработчик провел масштабное тестирование возможностей Claude Code, задействовав 11 специализированных субагентов для проверки работы с форматом PPTX. Эксперимент показал, что агентные системы демонстрируют разную эффективность в зависимости от сложности задач: от простого чтения метаданных до манипуляций со структурой слайдов. Результаты подчеркивают критическую важность выбора правильной стратегии декомпозиции задач при построении сложных агентных рабочих процессов.
В ходе исследования каждый из 11 агентов был настроен на выполнение специфических операций с файлами PowerPoint. Автор анализировал, как Claude Code справляется с контекстным окном, точностью выполнения инструкций и обработкой ошибок при работе с бинарными форматами документов. Использование субагентов позволило выявить слабые места в текущей реализации инструментов автоматизации, где агент сталкивается с ограничениями при глубокой иерархической обработке данных.
Полученные данные демонстрируют, что для надежной автоматизации офисных задач недостаточно базовых возможностей LLM. Требуется создание специализированных слоев оркестрации, которые управляют состоянием и контекстом для каждого подпроцесса. Этот подход позволяет минимизировать галлюцинации и повысить воспроизводимость результатов при работе с неструктурированными данными и сложными форматами файлов.
Ключевые факты
- В тестировании использовалось 11 специализированных субагентов, каждый из которых отвечал за отдельный аспект обработки PPTX.
- Основной фокус исследования был направлен на оценку стабильности Claude Code при выполнении многошаговых задач по манипуляции контентом.
- Выявлено, что эффективность агентов напрямую зависит от качества промптов для декомпозиции и способности системы сохранять контекст между вызовами.
- Эксперимент подтвердил, что агентные системы требуют глубокой интеграции с API для работы с бинарными форматами, чтобы избежать ошибок при парсинге.