Разработчик представил инструмент quantprobe, позволяющий значительно повысить скорость генерации токенов для крупных языковых моделей на ограниченных аппаратных ресурсах. Решение оптимизирует процесс инференса, достигая показателей в 22 токена в секунду для 30B-моделей и до 109 токенов в секунду на конфигурациях с 6–16 ГБ оперативной памяти, обходя стандартные ограничения llama.cpp.

Проект фокусируется на эффективном управлении памятью и методах квантования, которые позволяют запускать тяжелые модели на обычном пользовательском оборудовании без существенной потери качества. Основная цель разработки — преодолеть «бутылочное горлышко» пропускной способности памяти, которое обычно замедляет работу LLM при использовании только CPU или ограниченных ресурсов GPU.

Технология предлагает альтернативный подход к обработке весов модели, минимизируя задержки при обращении к оперативной памяти. Это делает запуск локальных моделей с большим количеством параметров доступным для широкого круга задач, где ранее требовались серверные мощности или специализированные ускорители с большим объемом видеопамяти.

Ключевые факты

  • Скорость инференса для 30B-моделей достигает 22 токенов в секунду.
  • Пиковая производительность в тестах составила 109 токенов в секунду.
  • Инструмент оптимизирован для работы в условиях ограниченной RAM (от 6 ГБ до 16 ГБ).
  • Решение разработано как альтернатива стандартным методам исполнения моделей в llama.cpp.
  • Проект доступен в открытом доступе на GitHub для тестирования и интеграции.