Разработчики представили решение, позволяющее запускать массивные MoE-модели (Mixture of Experts) с 120 миллиардами параметров на обычных Android-смартфонах среднего ценового сегмента. Используя оптимизированный движок llama.cpp, проект демонстрирует возможность выполнения инференса исключительно на центральном процессоре (CPU), что открывает новые перспективы для локальной работы с тяжелыми языковыми моделями без необходимости в специализированных GPU или облачных мощностях.

Ключевым аспектом реализации стала глубокая оптимизация управления памятью и вычислительными ресурсами при работе с архитектурой MoE. Поскольку такие модели требуют значительного объема оперативной памяти, авторы применили методы квантования и эффективного распределения весов, которые позволяют системе функционировать в условиях ограниченных аппаратных ресурсов мобильных устройств. Это решение снимает барьер для развертывания сложных ИИ-систем на пользовательских девайсах.

Технология опирается на возможности llama.cpp, который адаптирован для работы с мобильными архитектурами ARM. Проект доказывает, что даже при отсутствии выделенного нейронного ускорителя или мощного графического чипа, современные алгоритмы квантования позволяют запускать модели, ранее считавшиеся доступными только для серверного оборудования. Это важный шаг в сторону развития автономных агентных систем, работающих непосредственно на конечном устройстве пользователя.

Ключевые факты

  • Реализован запуск модели объемом 120 миллиардов параметров на мобильном процессоре.
  • Инференс выполняется полностью на CPU без использования GPU-ускорения.
  • Проект базируется на оптимизациях движка llama.cpp для платформы Android.
  • Решение ориентировано на смартфоны среднего сегмента с ограниченным объемом оперативной памяти.
  • Использованы методы квантования для эффективного сжатия весов модели при сохранении работоспособности.