ハードウェア・推論 🇺🇸 02.08.2026 11:02

NVIDIA Transformer Engine、融合カーネル、BF16、FP8、GPUベンチマークによるTransformerトレーニングの高速化

NVIDIANVIDIA
このチュートリアルでは、NVIDIA Transformer Engineが融合GPUカーネル、BF16計算、ハードウェア対応FP8実行を組み合わせることで、Transformerワークロードをどのように高速化するかを解説します。インストール、GPU検出、モジュールツアー、FP8レシピ設定、モデルトレーニング、ベンチマーク、自己回帰生成について説明します。
このチュートリアルは、NVIDIA Transformer EngineのインストールとPyTorch環境の初期化から始まります。GPUアーキテクチャを検出してTEカーネルとFP8テンソルコアがサポートされているかどうかを判断し、サポートされていないハードウェアには純粋なPyTorchによるフォールバックを使用します。te.Linear、te.LayerNorm、te.LayerNormLinear、te.LayerNormMLP、te.TransformerLayerなどの主要な融合コンポーネントを調べます。遅延スケーリングFP8レシピは、ハイブリッドE4M3/E5M2形式とamax履歴を使用して構成されます。融合されたte.TransformerLayerブロックを使用してコンパクトなGPTスタイルの因果言語モデルを構築し、比較用に同等の純粋なPyTorchモデルも実装します。モデルは決定的な合成算術パターン系列でトレーニングされ、サポートされている場合は条件付きFP8 autocastを使用します。ベンチマークでは、BF16モードとFP8モードの平均ステップレイテンシとピークGPUメモリを測定します。スケーリングファクターやamax履歴などのFP8メタデータを検査します。最後に、貪欲な自己回帰生成によってモデルが算術ストライドを学習していることを検証し、より大きなモデルや代替FP8形式などの拡張を提案します。
出典: MarkTechPost — 原文
関連記事 ↓
新着ニュース