Разработчик представил движок инференса Waste, позволяющий запускать массивные модели, такие как Kimi K3 с 2,78 трлн параметров, используя всего 29 ГБ оперативной памяти. Решение оптимизирует процесс вычислений, делая запуск сверхкрупных языковых моделей доступным на потребительском оборудовании, что значительно снижает порог входа для локального использования тяжелых нейросетевых архитектур без необходимости в серверных кластерах.

Основная идея проекта заключается в эффективном управлении памятью и минимизации накладных расходов при работе с весами модели. В отличие от стандартных фреймворков, которые требуют огромных объемов VRAM или RAM для загрузки всех параметров целиком, Waste применяет методы динамической подгрузки и оптимизированного доступа к данным. Это позволяет запускать модели, которые ранее считались «неподъемными» для обычных рабочих станций.

Технология ориентирована на разработчиков и энтузиастов, стремящихся использовать state-of-the-art модели в локальной среде. Использование движка позволяет существенно сократить затраты на инфраструктуру, сохраняя при этом возможность работы с моделями, обладающими высокой плотностью знаний и сложной структурой параметров. Проект демонстрирует потенциал оптимизации алгоритмов инференса для работы в условиях ограниченных аппаратных ресурсов.

Ключевые факты

  • Движок Waste оптимизирован для работы с моделями сверхбольшого размера, включая Kimi K3.
  • Модель Kimi K3 с 2,78 трлн параметров успешно функционирует при наличии 29 ГБ оперативной памяти.
  • Технология позволяет значительно снизить требования к объему видеопамяти (VRAM) и системной RAM.
  • Решение направлено на демократизацию доступа к запуску тяжелых LLM на потребительском «железе».
  • Подход фокусируется на эффективном управлении весами модели в процессе вычислений.