Donanım ve Çıkarım 🇺🇸 02.08.2026 11:02

NVIDIA Transformer Engine ile Transformer Eğitimini Hızlandırma: Fused Çekirdekler, BF16, FP8 ve GPU Karşılaştırması

NVIDIANVIDIA
Bu eğitim, NVIDIA Transformer Engine'in fused GPU çekirdekleri, BF16 hesaplama ve donanım odaklı FP8 yürütme kullanarak transformer iş yüklerini nasıl hızlandırdığını inceliyor. Kurulum, GPU algılama, modül turu, FP8 tarifi yapılandırması, model eğitimi, karşılaştırma ve oto-regresif üretim konularını kapsar.
Eğitim, NVIDIA Transformer Engine'in kurulumu ve PyTorch ortamının başlatılmasıyla başlar. TE çekirdeklerinin ve FP8 tensor çekirdeklerinin desteklenip desteklenmediğini belirlemek için GPU mimarisi algılanır ve desteklenmeyen donanım için saf PyTorch geri dönüşü sağlanır. te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP ve te.TransformerLayer gibi temel birleştirilmiş bileşenler incelenir. Karma E4M3/E5M2 formatları ve amax geçmişi ile gecikmeli ölçekleme (delayed-scaling) FP8 tarifi yapılandırılır. Birleştirilmiş te.TransformerLayer blokları kullanılarak kompakt bir GPT tarzı nedensel dil modeli oluşturulur ve karşılaştırma için eşdeğer bir saf PyTorch modeli uygulanır. Model, deterministik sentetik aritmetik desen dizileri üzerinde eğitilir ve desteklendiğinde koşullu FP8 otomatik döküm (autocast) kullanılır. Kıyaslama, BF16 ve FP8 modları için ortalama adım gecikmesini ve tepe GPU belleğini ölçer. Ölçekleme faktörleri ve amax geçmişi dahil FP8 meta verileri incelenir. Son olarak, açgözlü otoregresif üretim, modelin aritmetik adımı öğrendiğini doğrular ve daha büyük modeller ve alternatif FP8 formatları gibi uzantılar önerilir.
Kaynak: MarkTechPost — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler