Исследователи обнаружили, что большие языковые модели (LLM) реагируют на регистр текста подобно человеческому восприятию, где заглавные буквы выступают маркерами важности. Анализ 13 моделей показал, что изменение регистра существенно модулирует распределение внутреннего внимания нейросетей. Этот феномен доказывает, что архитектурные особенности моделей чувствительны к визуальным характеристикам входных данных, что влияет на точность обработки информации и расстановку приоритетов при генерации ответов.

В ходе работы авторы проанализировали девять текстовых LLM и четыре мультимодальные модели (Vision-Language Models). Выяснилось, что использование заглавных букв в тексте не просто меняет токенизацию, но и физически перенаправляет веса внимания внутри слоев трансформера. Модели склонны придавать больший «вес» словам, написанным в верхнем регистре, что может приводить к искажениям в логических выводах, если модель интерпретирует визуальное выделение как смысловой акцент.

Данное открытие имеет значение для разработки промптов и предобработки данных. Если модель воспринимает регистр как сигнал значимости, это можно использовать для управления фокусом внимания ИИ при решении сложных задач. Однако это также создает риски: случайное использование Caps Lock в запросах может непреднамеренно сместить логику модели, заставляя её игнорировать важные контекстные детали в пользу «выделенных» фрагментов.

Ключевые факты

  • Исследование охватило 13 различных моделей, включая как чисто текстовые LLM, так и мультимодальные системы.
  • Установлено, что заглавные буквы выступают естественным сигналом важности (salience cue), аналогично человеческому визуальному восприятию.
  • Регистр текста напрямую влияет на механизм распределения внимания (attention allocation) внутри архитектуры трансформера.
  • Эффект чувствительности к регистру может приводить к непредсказуемым смещениям в ответах моделей при обработке неструктурированных данных.