Ученые из Нью-Йоркского университета выяснили, что на начальных этапах чтения люди и языковые модели демонстрируют схожие механизмы обработки текста, опираясь на предсказание следующего слова. Однако по мере углубления в контекст стратегии обработки расходятся: люди начинают опираться на более глубокие семантические структуры, в то время как ИИ сохраняет зависимость от вероятностного прогнозирования токенов.

В ходе эксперимента исследователи сопоставили движения глаз людей при чтении с активностью нейронных сетей. Выяснилось, что предсказательная модель ИИ эффективно имитирует человеческую реакцию на часто встречающиеся или легко предсказуемые слова. Однако при столкновении с редкой лексикой или сложными синтаксическими конструкциями человеческий мозг переключается на стратегии, которые текущие архитектуры трансформеров пока не способны полноценно воспроизвести.

Эти данные помогают лучше понять ограничения современных LLM в задачах, требующих глубокого понимания смысла, а не просто статистической вероятности появления следующего элемента последовательности. Результаты исследования указывают на необходимость разработки новых методов обучения, которые могли бы приблизить когнитивные процессы моделей к человеческим при работе с нетривиальными текстами.

Ключевые факты

  • Исследование проведено специалистами Нью-Йоркского университета (NYU) с использованием данных отслеживания движений глаз.
  • Установлено, что на ранних стадиях обработки текста ИИ и человек используют схожие алгоритмы предсказания следующего слова.
  • При чтении сложных или редких слов люди демонстрируют когнитивные паттерны, которые отсутствуют у моделей, полагающихся исключительно на вероятностное распределение токенов.
  • Работа подчеркивает фундаментальное различие между статистическим предсказанием и семантическим пониманием в контексте обработки естественного языка.