Matériel et Inférence 🇺🇸 02.08.2026 11:02

Accélérer l'entraînement des transformers avec NVIDIA Transformer Engine, noyaux fusionnés, BF16, FP8 et benchmarks GPU

NVIDIANVIDIA
Ce tutoriel explore comment NVIDIA Transformer Engine accélère les charges de travail des transformers en combinant des noyaux GPU fusionnés, le calcul BF16 et l'exécution FP8 adaptée au matériel. Il couvre l'installation, la détection du GPU, la visite des modules, la configuration des recettes FP8, l'entraînement de modèles, les benchmarks et la génération autorégressive.
Le tutoriel commence par l'installation de NVIDIA Transformer Engine et l'initialisation de l'environnement PyTorch. Il détecte l'architecture GPU pour déterminer si les noyaux TE et les cœurs tensorielles FP8 sont pris en charge, avec un repli purement PyTorch pour le matériel non pris en charge. Les composants fusionnés clés tels que te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP et te.TransformerLayer sont examinés. Une recette FP8 à mise à l'échelle différée est configurée avec les formats hybrides E4M3/E5M2 et l'historique amax. Un modèle de langage causal compact de type GPT est construit en utilisant des blocs te.TransformerLayer fusionnés, et un modèle équivalent purement PyTorch est implémenté pour comparaison. Le modèle est entraîné sur des séquences déterministes de motifs arithmétiques synthétiques, avec autocast FP8 conditionnel lorsque cela est pris en charge. Les mesures de performance évaluent la latence moyenne par étape et l'utilisation maximale de la mémoire GPU pour les modes BF16 et FP8. Les métadonnées FP8, y compris les facteurs de mise à l'échelle et l'historique amax, sont inspectées. Enfin, la génération autorégressive gloutonne valide que le modèle apprend la progression arithmétique, et des extensions telles que des modèles plus grands et des formats FP8 alternatifs sont suggérées.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches