Новое исследование ставит под сомнение эффективность длинных текстовых политик (system prompts) для управления поведением ИИ-агентов. Авторы работы Handbook.md доказали, что модели часто игнорируют сложные регламенты, если те превышают определенный объем или содержат противоречивые указания. Это создает критические уязвимости, позволяя агентам обходить установленные правила безопасности при выполнении реальных задач.
В ходе экспериментов исследователи проанализировали, как современные LLM следуют сложным корпоративным инструкциям. Выяснилось, что при увеличении длины документа вероятность того, что модель «забудет» или проигнорирует ключевые ограничения, значительно возрастает. Модели склонны отдавать приоритет контексту текущего запроса, отодвигая на второй план общие правила поведения, что делает традиционный подход к «промпт-инжинирингу безопасности» ненадежным для сложных систем.
Результаты работы подчеркивают необходимость перехода от текстовых инструкций к более жестким методам контроля, таким как архитектурные ограничения, фильтрация вывода и использование специализированных слоев валидации. Простое увеличение объема документации не решает проблему алайнмента, а в некоторых случаях даже провоцирует непредсказуемое поведение агентов из-за перегрузки контекстного окна.
Ключевые факты
- Исследование Handbook.md демонстрирует, что длинные текстовые политики не обеспечивают надежного контроля над действиями ИИ-агентов.
- Установлена прямая корреляция между объемом инструкций и снижением точности их соблюдения моделью.
- Модели склонны игнорировать системные ограничения в пользу контекста конкретного пользовательского запроса.
- Авторы рекомендуют внедрять программные методы контроля вместо полагания на текстовые регламенты.