Разработчики успешно запустили модель DeepSeek V4 Flash на процессоре AMD Ryzen AI MAX+ 395 (Strix Halo), достигнув скорости генерации до 32 токенов в секунду. Этот результат демонстрирует эффективность работы современных LLM на локальных потребительских чипах с интегрированной графикой, что открывает новые возможности для запуска тяжелых моделей без использования дискретных GPU.

Ключевым фактором успеха стала оптимизация инференса под архитектуру NPU и встроенных графических ядер AMD. Использование специализированных библиотек для работы с тензорными вычислениями позволило эффективно распределить нагрузку между вычислительными блоками процессора. Это подтверждает тренд на снижение порога входа для локального развертывания высокопроизводительных языковых моделей.

Техническая реализация опирается на возможности платформы Strix Halo, которая обладает увеличенным объемом кэш-памяти и пропускной способностью шины памяти, критически важными для работы LLM. Данный кейс показывает, что современные мобильные платформы способны поддерживать работу моделей с большим количеством параметров, обеспечивая при этом приемлемую скорость взаимодействия для повседневных задач.

Ключевые факты

  • Модель: DeepSeek V4 Flash.
  • Аппаратная платформа: AMD Ryzen AI MAX+ 395 (архитектура Strix Halo).
  • Скорость инференса: до 32 токенов в секунду.
  • Основная оптимизация: использование интегрированных ресурсов процессора и графики для ускорения тензорных операций.