Исследователи представили метод PRECOG (Pre-Computed Context Injection), который радикально меняет работу RAG в моделях на базе State-Space Models (SSM). Технология позволяет сократить затраты на префилл с линейной зависимости от длины контекста до константного времени O(1). Это устраняет вычислительные задержки при извлечении данных, делая работу с большими корпусами документов на периферийных устройствах значительно эффективнее.

Традиционные архитектуры Transformer требуют значительных ресурсов на KV-кэш, который растет вместе с генерацией токенов, а стандартный RAG добавляет к этому тяжелый этап префилла. Использование SSM-архитектур уже решает проблему масштабирования кэша, однако PRECOG дополняет этот подход, позволяя «впрыскивать» состояние контекста напрямую. Такой подход превращает процесс поиска и интеграции внешней информации в практически мгновенную операцию, не зависящую от объема индексируемых данных.

Данная разработка критически важна для запуска сложных агентных систем на локальном оборудовании с ограниченной памятью. Устранение зависимости времени обработки от длины контекста открывает путь к созданию ИИ-ассистентов, способных мгновенно обращаться к огромным базам знаний без необходимости пересчета векторов или длительного ожидания ответа при каждом запросе.

Ключевые факты

  • Метод PRECOG снижает сложность префилла при RAG с O(L_context) до O(1).
  • Технология оптимизирована для State-Space Models (SSM), исключая необходимость в растущем KV-кэше.
  • Решение позволяет выполнять поиск по корпусу документов без линейного роста вычислительных затрат на каждый запрос.
  • Метод ориентирован на повышение производительности Edge-устройств при работе с большими объемами данных.