NVIDIA представила руководство по ускорению обучения трансформеров с использованием Transformer Engine, объединенных ядер (fused kernels) и форматов данных BF16 и FP8. Технология позволяет значительно повысить производительность GPT-подобных моделей при работе в PyTorch, сокращая время вычислений за счет эффективного управления памятью и использования аппаратных возможностей GPU архитектуры Hopper.

Основной упор в методологии сделан на использование FP8 с отложенным масштабированием (delayed scaling), что позволяет поддерживать высокую точность вычислений при снижении нагрузки на вычислительные блоки. Применение fused kernels минимизирует накладные расходы на передачу данных между памятью и процессором, объединяя несколько операций в один проход. Это критически важно для обучения больших языковых моделей, где пропускная способность памяти часто становится «узким местом».

Практическая часть включает настройку пайплайнов обучения для моделей казуального типа. Разработчики получают инструменты для профилирования и бенчмаркинга, что позволяет оценить прирост скорости в зависимости от выбранной конфигурации точности и оптимизации ядер. Использование данных подходов позволяет существенно снизить затраты на инфраструктуру при масштабировании обучения LLM.

Ключевые факты

  • Внедрение FP8 с отложенным масштабированием позволяет снизить потребление памяти и ускорить матричные вычисления на GPU NVIDIA.
  • Использование fused kernels сокращает количество обращений к глобальной памяти, объединяя операции в единый вычислительный поток.
  • Руководство ориентировано на обучение GPT-подобных моделей в среде PyTorch с акцентом на архитектуру GPU Hopper.
  • Методология включает пошаговую настройку бенчмаркинга для оценки производительности моделей в различных режимах точности (BF16, FP8).