Оптимизированная версия модели DeepSeek V4 Flash (релиз 0731) показала значительный прирост производительности при работе на потребительском и профессиональном железе. Тесты на одной видеокарте RTX 6000 Ada Generation подтвердили возможность достижения скорости префилла в 1328 токенов в секунду и декодирования на уровне 29 токенов в секунду при использовании 4-битной квантованной версии модели.

Такие показатели производительности стали возможны благодаря глубокой оптимизации архитектуры модели и методов квантования, что позволяет запускать современные LLM с высокой пропускной способностью на одиночных GPU. Использование квантования Q4 существенно снижает требования к видеопамяти, сохраняя при этом приемлемое качество генерации, что делает модель пригодной для локального развертывания в задачах, требующих низких задержек.

Высокая скорость обработки префилла критически важна для систем RAG и работы с длинными контекстами, где первичная обработка входящих данных часто становится «бутылочным горлышком». Стабильные 29 токенов в секунду при декодировании обеспечивают комфортную работу в режиме реального времени, что открывает возможности для интеграции мощных моделей в локальные агентные системы без необходимости обращения к облачным API.

Ключевые факты

  • Модель: DeepSeek V4 Flash (версия от 31 июля).
  • Железо: одна видеокарта NVIDIA RTX 6000 Ada Generation.
  • Скорость префилла: 1328 токенов в секунду.
  • Скорость декодирования: 29 токенов в секунду.
  • Метод оптимизации: 4-битное квантование (Q4).