Проект ExpertCache позволяет запускать массивные LLM (например, GPT-OSS 120B, требующие 63 ГБ памяти) на потребительском железе с 16 ГБ оперативной памяти, таком как MacBook M1 Pro. Технология использует кэширование экспертов (MoE) и эффективное управление памятью, что радикально снижает требования к VRAM/RAM для инференса сверхбольших моделей без существенной потери качества генерации.

Основная проблема запуска моделей уровня 100B+ параметров заключается в необходимости огромного объема видеопамяти, что делает их недоступными для локального использования на обычных ноутбуках. ExpertCache решает эту задачу, динамически подгружая только необходимые веса экспертов из MoE-архитектуры в оперативную память, минимизируя обращения к диску и оптимизируя пропускную способность шины памяти.

Этот подход открывает возможности для локального развертывания мощных агентных систем и сложных моделей, которые ранее требовали серверных GPU с большим объемом памяти. Метод ориентирован на архитектуры Mixture-of-Experts, где активация всех параметров модели при каждом токене избыточна, что позволяет эффективно использовать кэширование для ускорения работы на устройствах с ограниченными ресурсами.

Ключевые факты

  • Поддерживает запуск моделей объемом 120B параметров (63 ГБ) на устройствах с 16 ГБ RAM.
  • Технология оптимизирована для архитектур Mixture-of-Experts (MoE).
  • Значительно снижает требования к объему памяти за счет интеллектуального кэширования весов экспертов.
  • Проект доступен в открытом доступе на GitHub под названием ExpertCache.
  • Ориентирован на локальный инференс на потребительских чипах Apple Silicon.