Исследователи провели контролируемый эксперимент, чтобы выяснить, как структура промптов, количество инструкций и длина контекста влияют на точность выполнения задач и склонность моделей к галлюцинациям. Работа закрывает пробел в эмпирических данных, помогая разработчикам оптимизировать системные промпты для повышения надежности ИИ-систем при работе с большими объемами данных и сложными наборами правил.
В ходе исследования тестировались различные форматы представления данных: от простого текста и прозы до разметки Markdown и табличных структур. Авторы проанализировали, в какой момент добавление новых инструкций начинает снижать качество их соблюдения, а также определили пороги контекстного окна, после которых показатели воспроизведения информации и честности ответов модели начинают заметно падать.
Результаты показывают, что выбор формата и плотность инструкций критически важны для минимизации ошибок. Вместо интуитивного проектирования промптов, авторы предлагают опираться на количественные показатели, которые позволяют предсказать поведение модели при масштабировании системных требований. Это особенно актуально для сложных агентных сценариев, где модель должна удерживать в памяти множество ограничений одновременно.
Ключевые факты
- Исследование охватывает три ключевых параметра: формат данных, количество одновременных инструкций и длину контекста.
- Проведены два масштабных контролируемых эксперимента для оценки влияния этих факторов на соблюдение инструкций.
- Выявлена прямая зависимость между плотностью системного промпта и деградацией качества ответов модели.
- Работа предоставляет практические метрики для определения пределов «честности» и точности извлечения данных при росте контекстного окна.