Разработчики представили DeepSeek-V4-Flash — оптимизированную версию модели, демонстрирующую почти трехкратный прирост скорости инференса на кластерах из четырех графических процессоров NVIDIA B200. Главная особенность релиза заключается в достижении высокой производительности без потери точности (lossless), что позволяет значительно сократить время отклика и затраты на вычислительные ресурсы при работе с крупными языковыми моделями в продакшене.
Оптимизация сосредоточена на эффективном использовании тензорных ядер и архитектурных особенностей чипов Blackwell. За счет переработки механизмов передачи данных между GPU и снижения накладных расходов при выполнении операций, удалось добиться кратного ускорения генерации токенов. Это решение ориентировано на инфраструктурные задачи, где критически важна низкая задержка при сохранении качества ответов модели.
Технология позволяет более эффективно масштабировать агентные системы и сложные RAG-пайплайны, требующие интенсивных вычислений в реальном времени. Снижение времени инференса напрямую влияет на стоимость эксплуатации систем, позволяя обрабатывать больше запросов на аналогичном аппаратном обеспечении без необходимости компромиссов в качестве генерации контента.
Ключевые факты
- Коэффициент ускорения инференса составляет 2,98x по сравнению со стандартными методами запуска.
- Тестирование проводилось на конфигурации из четырех ускорителей NVIDIA B200.
- Оптимизация является «lossless», то есть не приводит к деградации качества ответов модели.
- Решение направлено на повышение эффективности инфраструктуры для высоконагруженных ИИ-систем.