Проект ExpertCache позволяет запускать массивные LLM (например, GPT-OSS 120B, требующие 63 ГБ памяти) на потребительском железе с 16 ГБ оперативной памяти, таком как MacBook M1 Pro. Технология использует кэширование экспертов (MoE) и эффективное управление памятью, что радикально снижает требования к VRAM/RAM для инференса сверхбольших моделей без существенной потери качества генерации.
Основная проблема запуска моделей уровня 100B+ параметров заключается в необходимости огромного объема видеопамяти, что делает их недоступными для локального использования на обычных ноутбуках. ExpertCache решает эту задачу, динамически подгружая только необходимые веса экспертов из MoE-архитектуры в оперативную память, минимизируя обращения к диску и оптимизируя пропускную способность шины памяти.
Этот подход открывает возможности для локального развертывания мощных агентных систем и сложных моделей, которые ранее требовали серверных GPU с большим объемом памяти. Метод ориентирован на архитектуры Mixture-of-Experts, где активация всех параметров модели при каждом токене избыточна, что позволяет эффективно использовать кэширование для ускорения работы на устройствах с ограниченными ресурсами.
Ключевые факты
- Поддерживает запуск моделей объемом 120B параметров (63 ГБ) на устройствах с 16 ГБ RAM.
- Технология оптимизирована для архитектур Mixture-of-Experts (MoE).
- Значительно снижает требования к объему памяти за счет интеллектуального кэширования весов экспертов.
- Проект доступен в открытом доступе на GitHub под названием ExpertCache.
- Ориентирован на локальный инференс на потребительских чипах Apple Silicon.