Оптимизированная версия модели DeepSeek V4 Flash (релиз 0731) показала значительный прирост производительности при работе на потребительском и профессиональном железе. Тесты на одной видеокарте RTX 6000 Ada Generation подтвердили возможность достижения скорости префилла в 1328 токенов в секунду и декодирования на уровне 29 токенов в секунду при использовании 4-битной квантованной версии модели.
Такие показатели производительности стали возможны благодаря глубокой оптимизации архитектуры модели и методов квантования, что позволяет запускать современные LLM с высокой пропускной способностью на одиночных GPU. Использование квантования Q4 существенно снижает требования к видеопамяти, сохраняя при этом приемлемое качество генерации, что делает модель пригодной для локального развертывания в задачах, требующих низких задержек.
Высокая скорость обработки префилла критически важна для систем RAG и работы с длинными контекстами, где первичная обработка входящих данных часто становится «бутылочным горлышком». Стабильные 29 токенов в секунду при декодировании обеспечивают комфортную работу в режиме реального времени, что открывает возможности для интеграции мощных моделей в локальные агентные системы без необходимости обращения к облачным API.
Ключевые факты
- Модель: DeepSeek V4 Flash (версия от 31 июля).
- Железо: одна видеокарта NVIDIA RTX 6000 Ada Generation.
- Скорость префилла: 1328 токенов в секунду.
- Скорость декодирования: 29 токенов в секунду.
- Метод оптимизации: 4-битное квантование (Q4).