Исследователи обнаружили, что передовые языковые модели испытывают критические трудности с точным копированием входных строк, даже если они находятся внутри контекстного окна. Проблема кроется в архитектурных особенностях Transformer, а именно в позиционном кодировании. Модели склонны полагаться на локальные паттерны, что мешает им воспроизводить длинные последовательности символов без искажений, несмотря на их высокие способности к логическому выводу.

Авторы работы объясняют этот феномен тем, что текущие механизмы позиционирования создают индуктивное смещение, которое отдает приоритет локальным связям в ущерб глобальной точности при воспроизведении данных. В результате даже самые мощные модели допускают ошибки в задачах, которые кажутся тривиальными для классических алгоритмов обработки строк. Это ограничение становится заметным при работе с кодом или специфическими идентификаторами, где точность каждого символа критична.

Для решения проблемы авторы предлагают рассматривать текстовые данные в двухмерном представлении. Такой подход позволяет моделям лучше учитывать структуру и позиционные зависимости, минимизируя ошибки копирования. Исследование ставит под сомнение эффективность стандартных архитектурных решений в задачах, требующих высокой точности воспроизведения исходной информации, и указывает на необходимость пересмотра методов обработки позиционной информации в будущих архитектурах.

Ключевые факты

  • Модели демонстрируют низкую точность при попытке дословно воспроизвести входную строку, находящуюся в пределах контекстного окна.
  • Основной причиной сбоев названо позиционное кодирование в архитектуре Transformer, которое отдает предпочтение локальному сопоставлению.
  • Предложенный метод 2D-представления текста позволяет снизить количество ошибок при копировании данных.
  • Ограничение проявляется даже у «фронтирных» моделей, обладающих развитыми навыками логического мышления.