Исследователи представили PIVOT — метод эффективной индексации групп запросов для разреженного внимания на уровне токенов. Решение устраняет квадратичную сложность O(L²) при выборе top-k токенов, характерную для систем вроде DeepSeek Sparse Attention. PIVOT оптимизирует процесс индексации, позволяя значительно снизить вычислительные затраты при работе с длинными контекстами в продакшн-системах.

В современных архитектурах с разреженным вниманием (sparse attention) механизм выбора наиболее релевантных токенов часто становится «узким местом». Индексатор вынужден перебирать все предыдущие токены для каждого запроса, что замедляет инференс при увеличении длины последовательности. PIVOT переосмысливает этот процесс, используя групповую индексацию, которая минимизирует количество необходимых операций сканирования.

Данный подход позволяет масштабировать работу с контекстом без линейного роста вычислительной нагрузки на каждый слой модели. Это критически важно для развертывания LLM в реальном времени, где задержка (latency) является определяющим фактором при обработке длинных документов или сложных агентных цепочек рассуждений.

Ключевые факты

  • PIVOT решает проблему O(L²) сложности при выборе top-k токенов в разреженном внимании.
  • Метод оптимизирует работу индексатора, который является основным ограничением в архитектурах типа DeepSeek Sparse Attention.
  • Технология направлена на повышение эффективности инференса при обработке длинных последовательностей токенов.
  • Разработка позволяет снизить вычислительные затраты на каждом слое нейронной сети при сохранении точности внимания.