Сальваторе Санфилиппо (antirez) продемонстрировал метод запуска крупной языковой модели Kimi K3 на локальном оборудовании с ограниченной видеопамятью. Используя технику потоковой передачи весов модели непосредственно с диска или сети, он добился работы системы на MacBook M5 Max с 128 ГБ оперативной памяти, минуя необходимость полной загрузки всей модели в VRAM.
Этот подход решает одну из главных проблем локального инференса — нехватку видеопамяти для запуска современных моделей с большим количеством параметров. Вместо того чтобы пытаться уместить всю нейросеть в память GPU, система подгружает необходимые веса «на лету» по мере генерации токенов. Это позволяет энтузиастам и разработчикам запускать мощные модели на потребительском железе, которые ранее требовали серверных кластеров.
Технология опирается на эффективное управление памятью и минимизацию задержек при чтении данных. Подобные решения открывают путь к более доступному локальному инференсу, позволяя тестировать и использовать state-of-the-art модели без облачных затрат, сохраняя при этом приватность данных и полный контроль над вычислительным процессом.
Ключевые факты
- Модель Kimi K3 успешно запущена на устройстве с архитектурой Apple Silicon M5 Max.
- Общий объем оперативной памяти тестовой системы составил 128 ГБ.
- Использован метод потоковой передачи весов (streaming weights), исключающий необходимость полной предварительной загрузки модели в память.
- Решение позволяет запускать модели, размер которых превышает объем доступной видеопамяти графического ускорителя.