Библиотека AirLLM открывает возможность запуска сверхкрупных языковых моделей, таких как Kimi K3 (2.8 трлн параметров), на обычном потребительском оборудовании с объемом видеопамяти всего 4 ГБ. Инструмент оптимизирует процесс инференса, позволяя выполнять вычисления на устройствах, которые ранее считались технически непригодными для работы с моделями подобного масштаба из-за жестких ограничений по VRAM.

Технология базируется на методе послойной загрузки весов модели в память. Вместо того чтобы пытаться разместить всю нейросеть целиком, AirLLM последовательно подгружает необходимые фрагменты весов, выполняет вычисления и выгружает их, минимизируя нагрузку на GPU. Это значительно снижает порог входа для исследователей и разработчиков, желающих экспериментировать с передовыми архитектурами без доступа к дорогостоящим серверным кластерам с десятками видеокарт A100 или H100.

Помимо поддержки Kimi K3, фреймворк совместим с широким спектром моделей, включая Llama 3 и другие архитектуры, использующие стандартные форматы весов. Решение ориентировано на локальный запуск и прототипирование, где критически важна доступность ресурсов при сохранении возможности работы с «тяжелыми» весами, которые обычно требуют терабайты оперативной памяти.

Ключевые факты

  • AirLLM обеспечивает инференс моделей с 2.8 трлн параметров на GPU с 4 ГБ видеопамяти.
  • Метод основан на послойной обработке весов, что исключает необходимость полной загрузки модели в VRAM.
  • Инструмент поддерживает работу с популярными архитектурами, включая Llama 3 и Kimi K3.
  • Решение значительно снижает стоимость и требования к аппаратному обеспечению для запуска LLM высокого порядка.