Разработчики представили Maple-Preview — технологию, позволяющую запускать тернарную (3-битные веса) Mixture-of-Experts модель с 20 миллиардами параметров непосредственно на мобильных устройствах Apple. Решение достигает производительности в 120 токенов в секунду на iPhone, что делает возможным работу сложных локальных LLM с высокой скоростью отклика без обращения к облачным серверам.
Достижение такой скорости на мобильном железе стало возможным благодаря оптимизации архитектуры MoE и использованию тернарного квантования. Это позволяет значительно снизить требования к оперативной памяти и вычислительной мощности при сохранении качества генерации, характерного для моделей среднего размера. Технология ориентирована на сценарии, где критически важна приватность данных и работа в офлайн-режиме.
Использование локального инференса на устройствах Apple опирается на возможности нейронного движка (Neural Engine) и эффективное управление памятью в рамках экосистемы iOS. Подобные решения открывают путь к созданию полноценных автономных ИИ-агентов, работающих на смартфонах без задержек, связанных с передачей данных по сети.
Ключевые факты
- Модель: 20B MoE (Mixture-of-Experts) с тернарным квантованием.
- Скорость работы: 120 токенов в секунду на аппаратном обеспечении iPhone.
- Технология: оптимизированный локальный инференс для мобильных процессоров Apple Silicon.
- Преимущество: отсутствие необходимости в облачной инфраструктуре и полная приватность пользовательских данных.