Опубликованы результаты замеров производительности инференса больших языковых моделей на процессорах Apple Silicon. Исследование охватывает широкий спектр чипов серии M, предоставляя данные по скорости генерации токенов в секунду для различных конфигураций памяти и моделей. Эти метрики помогают оценить реальные возможности локального запуска ИИ на потребительском оборудовании Apple.

В ходе тестирования использовались различные архитектуры моделей, чтобы определить зависимость скорости от объема оперативной памяти и пропускной способности шины данных. Результаты демонстрируют, как именно унифицированная архитектура памяти Apple влияет на задержки при обработке запросов, что критически важно для разработчиков, планирующих развертывание локальных агентных систем или RAG-решений на базе macOS.

Данные позволяют точнее прогнозировать производительность при выборе конкретной конфигурации ноутбука или десктопа для задач инференса. Это особенно актуально для тех, кто стремится минимизировать затраты на облачные вычисления, перенося выполнение моделей на локальные мощности без существенной потери в скорости отклика.

Ключевые факты

  • Тестирование охватывает чипы Apple M1, M2 и M3 в различных модификациях (Base, Pro, Max, Ultra).
  • Замеры включают показатели токенов в секунду (tokens/sec) для моделей разного размера и квантования.
  • Использованы открытые данные, доступные для анализа под лицензией CC BY 4.0.
  • Исследование наглядно показывает влияние пропускной способности памяти на скорость работы LLM при локальном запуске.
  • Опубликованные таблицы позволяют сравнить эффективность инференса в зависимости от объема объединенной памяти (Unified Memory).