Компания Lucebox представила результаты тестирования своей новой архитектуры на базе ускорителей AMD, которая показала 3,63-кратное преимущество в производительности при инференсе модели DeepSeek V4 по сравнению с системой Nvidia DGX Spark. Достижение стало возможным благодаря внедрению асимметричного параллелизма, оптимизирующего распределение вычислительной нагрузки между узлами при работе с крупными языковыми моделями.
Основная проблема традиционных кластеров при работе с моделями типа DeepSeek V4 заключается в неэффективном использовании памяти и пропускной способности интерконнекта. Подход Lucebox пересматривает принципы параллелизации, позволяя системе динамически перераспределять задачи между вычислительными блоками. Это минимизирует задержки при передаче данных, которые обычно становятся «бутылочным горлышком» в стандартных конфигурациях на базе Nvidia.
Технология ориентирована на снижение стоимости инференса для высоконагруженных систем. Использование асимметричных схем позволяет эффективнее задействовать аппаратные ресурсы, сокращая время генерации токенов. Данный результат подчеркивает растущую конкуренцию в сегменте инфраструктуры для запуска тяжелых моделей, где оптимизация программного стека становится столь же важной, как и мощность самих GPU.
Ключевые факты
- Ускорение инференса DeepSeek V4 составило 3,63 раза относительно эталонной системы Nvidia DGX Spark.
- В основе решения лежит метод асимметричного параллелизма, адаптированный под архитектуру ускорителей AMD.
- Оптимизация направлена на устранение задержек при обмене данными между узлами в распределенных вычислительных средах.
- Решение позволяет значительно повысить пропускную способность токенов в секунду для моделей с архитектурой Mixture-of-Experts (MoE).