Разработчики Claude Code успешно сократили объем системных инструкций на 80%, что позволило существенно снизить затраты на токены и ускорить время отклика без потери качества выполнения задач. Исследование проверяет, применима ли подобная стратегия сжатия контекста к компактным языковым моделям, которые часто ограничены в способности следовать сложным и длинным системным директивам.
Основная проблема длинных системных промптов заключается в «размытии» внимания модели, когда избыточный текст снижает точность выполнения инструкций. В случае с Claude Code оптимизация была достигнута за счет удаления избыточных описаний и перехода к более лаконичным, структурированным командам. Это не только экономит бюджет на инференс, но и повышает предсказуемость поведения агента в узкоспециализированных задачах.
Для малых моделей (параметрами до 7-10 млрд) чрезмерное сокращение промпта может привести к деградации логики, так как такие системы сильнее зависят от контекстных подсказок. Эксперименты показывают, что для них критически важно сохранять ключевые ограничения и формат вывода, даже если общая длина промпта уменьшается. Баланс между краткостью и полнотой инструкций становится ключевым фактором эффективности при развертывании ИИ-решений на периферийных устройствах.
Ключевые факты
- Сокращение системного промпта Claude Code на 80% позволило значительно снизить стоимость каждого вызова API.
- Длинные системные инструкции повышают риск «галлюцинаций» и снижают точность следования сложным алгоритмам у моделей среднего размера.
- Для компактных моделей (Small Language Models) критически важно сохранять структуру вывода, так как они хуже справляются с восстановлением контекста из сжатых данных.
- Оптимизация промптов напрямую коррелирует с уменьшением задержки (latency) при генерации первого токена.
- Методология сжатия включает удаление «шумовых» инструкций и переход к формату, оптимизированному под конкретные задачи агента.