Исследователи представили InferScale — метод оптимизации инференса LLM, который ускоряет обработку персонализированного контекста. Вместо повторного префилла памяти при каждом запросе система выполняет прямую инъекцию KV-кэша на уровне GPU. Это позволяет значительно сократить задержки и вычислительные затраты при работе с долгосрочной памятью агентов, сохраняя при этом высокую точность генерации ответов.
Современные агентные системы, такие как Mem0 или MemGPT, часто сталкиваются с проблемой избыточных вычислений. При каждом обращении к модели система вынуждена заново обрабатывать накопленный контекст пользователя, что создает «узкое горлышко» в производительности. InferScale решает эту задачу, перенося работу с кэшем непосредственно в среду исполнения модели, минуя стадию повторной токенизации и обработки промпта.
Технология позволяет эффективно масштабировать сервисы, использующие RAG или агентную память, без необходимости переобучения моделей. Метод обеспечивает совместимость с существующими движками инференса, позволяя динамически подгружать профили пользователей в KV-кэш GPU. Это открывает путь к созданию более отзывчивых ИИ-ассистентов, способных мгновенно учитывать историю взаимодействия без потери производительности при росте объема накопленных данных.
Ключевые факты
- InferScale внедряет персонализированный контекст напрямую в KV-кэш GPU, исключая повторный префилл.
- Метод оптимизирует работу систем с долгосрочной памятью, таких как Mem0, MemGPT и Zep.
- Технология снижает вычислительную нагрузку при обработке повторяющихся данных в многопользовательских средах.
- Решение ориентировано на повышение пропускной способности серверов при работе с глубоко персонализированными LLM-агентами.