Проект SALT предлагает экспериментальный метод запуска больших языковых моделей, использующий структуру префиксного дерева (trie) для повышения эффективности использования оперативной памяти. Решение направлено на оптимизацию инференса за счет дедупликации общих префиксов в запросах, что позволяет снизить потребление ресурсов при работе с длинными контекстами или повторяющимися паттернами в генерации текста.
Традиционные подходы к инференсу часто избыточно хранят повторяющиеся токены в KV-кэше. Использование структуры trie позволяет хранить общие последовательности токенов в едином узле дерева, что значительно сокращает объем занимаемой памяти. Это особенно актуально для сценариев, где модель обрабатывает множество похожих запросов или выполняет многошаговые агентные задачи с общим системным промптом.
Разработка находится на ранней стадии и ориентирована на создание легковесного движка для локального запуска моделей. Авторы проекта открыли исходный код для привлечения сообщества к доработке механизмов управления памятью и интеграции с популярными форматами весов моделей. Подобные архитектурные решения критически важны для масштабирования агентных систем на устройствах с ограниченными аппаратными мощностями.
Ключевые факты
- SALT использует структуру данных trie для дедупликации токенов в памяти при инференсе.
- Основная цель проекта — минимизация потребления RAM за счет исключения дублирования данных в KV-кэше.
- Инструмент ориентирован на локальный запуск LLM и оптимизацию работы с повторяющимися контекстами.
- Проект опубликован на GitHub как open-source решение с открытым призывом к контрибьюторам.