Исследователи представили метод Windowed-MTP, решающий проблему избыточных вычислений при использовании многотокенового предсказания (MTP) в моделях с контекстом в миллион токенов. Традиционные MTP-головки при генерации текста вынуждены обрабатывать весь KV-кэш, что создает критическую нагрузку на память и вычислительные ресурсы. Новый подход ограничивает область внимания MTP-головки, сохраняя скорость генерации без потери качества предсказаний.

В современных архитектурах MTP-головки часто становятся «узким местом», так как их работа требует выполнения полного механизма внимания по всей длине контекста. Это нивелирует преимущество спекулятивного декодирования, делая процесс генерации затратным на длинных последовательностях. Windowed-MTP предлагает использовать локальное окно внимания для драфт-модели, что позволяет значительно снизить объем вычислений KV-кэша.

Данный метод позволяет масштабировать использование MTP на модели с контекстом в миллионы токенов, не увеличивая задержку инференса. Это критически важно для систем, работающих с большими документами или длинными историями диалогов, где стоимость каждого дополнительного токена в кэше становится определяющим фактором производительности всей инфраструктуры.

Ключевые факты

  • Метод Windowed-MTP устраняет необходимость выполнения полного внимания по всему KV-кэшу при генерации токенов.
  • Решение оптимизирует работу MTP-головок, которые в стандартном исполнении становятся вычислительно дорогими при контексте в 1 млн токенов.
  • Подход сохраняет эффективность спекулятивного декодирования, позволяя параллельно верифицировать предложенные токены.
  • Технология направлена на снижение нагрузки на GPU при работе с длинными контекстами, что критично для высоконагруженных систем инференса.