Сальваторе Санфилиппо (antirez) продемонстрировал метод запуска крупной языковой модели Kimi K3 на локальном оборудовании с ограниченной видеопамятью. Используя технику потоковой передачи весов модели непосредственно с диска или сети, он добился работы системы на MacBook M5 Max с 128 ГБ оперативной памяти, минуя необходимость полной загрузки всей модели в VRAM.

Этот подход решает одну из главных проблем локального инференса — нехватку видеопамяти для запуска современных моделей с большим количеством параметров. Вместо того чтобы пытаться уместить всю нейросеть в память GPU, система подгружает необходимые веса «на лету» по мере генерации токенов. Это позволяет энтузиастам и разработчикам запускать мощные модели на потребительском железе, которые ранее требовали серверных кластеров.

Технология опирается на эффективное управление памятью и минимизацию задержек при чтении данных. Подобные решения открывают путь к более доступному локальному инференсу, позволяя тестировать и использовать state-of-the-art модели без облачных затрат, сохраняя при этом приватность данных и полный контроль над вычислительным процессом.

Ключевые факты

  • Модель Kimi K3 успешно запущена на устройстве с архитектурой Apple Silicon M5 Max.
  • Общий объем оперативной памяти тестовой системы составил 128 ГБ.
  • Использован метод потоковой передачи весов (streaming weights), исключающий необходимость полной предварительной загрузки модели в память.
  • Решение позволяет запускать модели, размер которых превышает объем доступной видеопамяти графического ускорителя.