Исследователи обнаружили феномен «висячего документа» в работе Claude 3.5 Opus, при котором подача минималистичного промпта из нескольких символов (например, «--») заставляет модель генерировать длинные, связные тексты. Вместо отказа от обработки бессмысленного запроса, нейросеть интерпретирует его как сигнал к продолжению скрытого контекста или завершению вымышленного повествования, что указывает на уязвимости в механизмах управления вниманием и системными инструкциями.
Этот эффект демонстрирует, как LLM пытаются заполнить информационный вакуум, опираясь на вероятностные закономерности обучения, а не на логику диалога. Когда модель сталкивается с неоднозначным или «пустым» вводом, она обращается к внутренним паттернам генерации, имитируя продолжение существующего документа. Это создает риски непредсказуемого поведения в агентных системах, где подобные «триггеры» могут случайно активировать генерацию нежелательного контента или исказить логику выполнения задач.
Подобное поведение подчеркивает важность жесткой валидации входных данных и настройки параметров температуры при работе с крупными языковыми моделями. Разработчикам следует учитывать, что современные модели склонны к «творческой интерпретации» даже минимальных сигналов, что требует внедрения дополнительных уровней фильтрации и контроля за тем, как именно модель воспринимает пустые или аномальные промпты в рамках автоматизированных пайплайнов.
Ключевые факты
- Модель Claude 3.5 Opus генерирует до 5000 токенов текста в ответ на промпт из двух дефисов.
- Феномен назван «эффектом висячего документа» (dangling document effect), так как модель ведет себя так, будто продолжает уже существующий текст.
- Поведение проявляется из-за склонности архитектуры трансформеров к заполнению контекстного окна при отсутствии четких инструкций.
- Исследование подтверждает, что даже минимальные символьные последовательности могут выступать триггерами для глубокой генерации, минуя стандартные фильтры безопасности.