Проект turbo-fieldfare представил метод оптимизированного инференса для модели Gemma 2 27B, позволяющий запускать её на устройствах Apple с процессорами серии M, используя всего 2 ГБ оперативной памяти. Решение базируется на архитектуре A4B (Activation-aware 4-bit), которая значительно снижает требования к ресурсам при сохранении работоспособности нейросети на потребительском «железе» без необходимости в мощных GPU.
Технология использует специфические методы квантования и управления памятью, адаптированные под архитектуру Apple Silicon. Это позволяет выполнять инференс больших языковых моделей на стандартных ноутбуках, которые ранее были ограничены объемом доступной оперативной памяти. Разработка ориентирована на локальное выполнение задач, исключая необходимость в облачных вычислениях для работы с моделями подобного класса.
Данный подход открывает возможности для интеграции тяжелых моделей в локальные агентные системы и приложения, работающие непосредственно на клиентских устройствах. Оптимизация памяти достигается за счет агрессивного сжатия весов и эффективной работы с кэшем, что делает запуск моделей с десятками миллиардов параметров доступным для широкого круга пользователей MacBook.
Ключевые факты
- Модель: Gemma 2 27B (в реализации A4B).
- Требования к памяти: ~2 ГБ RAM.
- Целевое оборудование: Apple MacBook с процессорами M-серии.
- Метод оптимизации: Activation-aware 4-bit (A4B) квантование.
- Репозиторий проекта: drumih/turbo-fieldfare на GitHub.