NVIDIA продемонстрировала возможности своей новой вычислительной платформы GB200 NVL72, установив рекорд эффективности при обучении Mixture-of-Experts (MoE) моделей. Использование специализированного оборудования позволило значительно ускорить процесс обработки токенов и оптимизировать распределение вычислительных ресурсов, что становится критически важным фактором для масштабирования современных frontier-моделей и преодоления ограничений традиционных архитектур обучения.

Переход к архитектуре MoE требует пересмотра подходов к организации памяти и пропускной способности каналов связи между графическими процессорами. В ходе тестов инженеры сфокусировались на минимизации задержек при обмене данными между узлами, что позволило достичь высокой степени параллелизма. Это решение демонстрирует, как аппаратная оптимизация напрямую влияет на скорость сходимости моделей при работе с огромными массивами данных.

Масштабируемость системы обеспечивается за счет объединения 72 графических процессоров в единый вычислительный узел, работающий как один гигантский GPU. Такой подход позволяет эффективно распределять экспертные блоки модели между вычислительными мощностями, снижая накладные расходы на коммуникацию и повышая общую производительность обучения в задачах с интенсивным использованием памяти.

Ключевые факты

  • Платформа GB200 NVL72 объединяет 72 графических процессора в единый кластер с высокой пропускной способностью.
  • Архитектура MoE выбрана как основной стандарт для обучения моделей нового поколения из-за эффективности использования вычислительных ресурсов на токен.
  • Использование NVLink Switch System обеспечивает прямое взаимодействие между всеми GPU в стойке, устраняя узкие места при передаче данных.
  • Тестирование подтвердило способность системы поддерживать линейное масштабирование производительности при увеличении количества параметров модели.