Метод HotPin позволяет запускать массивные MoE-модели (Mixture of Experts) объемом 120 млрд параметров на потребительском оборудовании с 24 ГБ оперативной памяти. Решение использует стратегию кэширования экспертов, минимизируя нагрузку на систему при сохранении точности вычислений. Это открывает возможности для локального инференса тяжелых моделей без необходимости в дорогостоящих серверных GPU с огромным объемом видеопамяти.
Технология опирается на принцип «горячего» кэширования наиболее часто используемых экспертов в оперативной памяти. В архитектуре MoE только часть параметров модели активируется для каждого токена, что позволяет HotPin динамически подгружать нужные веса, не удерживая всю модель в памяти целиком. Реализация занимает около 50 строк кода, что делает её доступной для интеграции в существующие пайплайны локального запуска.
Подход решает проблему «бутылочного горлышка» при работе с большими языковыми моделями, где объем VRAM традиционно ограничивал выбор доступных архитектур. Использование CPU в связке с оптимизированным управлением памятью позволяет пользователям запускать модели, которые ранее требовали кластеров из нескольких GPU уровня A100 или H100.
Ключевые факты
- Метод поддерживает запуск моделей класса 120B MoE на стандартных конфигурациях с 24 ГБ RAM.
- Реализация алгоритма требует всего 50 строк кода, что упрощает внедрение в сторонние проекты.
- Технология использует принцип селективной загрузки экспертов, снижая требования к объему памяти без потери качества генерации.
- Решение ориентировано на работу с CPU, что снижает порог входа для локального развертывания тяжелых моделей.