Hardware e Inferência 🇺🇸 02.08.2026 11:02

Acelerando o Treinamento de Transformers com o NVIDIA Transformer Engine, Kernels Fundidos, BF16, FP8 e Benchmarking de GPU

NVIDIANVIDIA
Este tutorial explora como o NVIDIA Transformer Engine acelera cargas de trabalho de transformers combinando kernels de GPU fundidos, computação em BF16 e execução em FP8 consciente do hardware. Ele cobre instalação, detecção de GPU, tour de módulos, configuração de receita FP8, treinamento de modelos, benchmarking e geração autorregressiva.
O tutorial começa instalando o NVIDIA Transformer Engine e inicializando o ambiente PyTorch. Ele detecta a arquitetura da GPU para determinar se os kernels TE e os tensor cores FP8 são suportados, com um fallback puramente em PyTorch para hardware não suportado. Componentes fundidos centrais, como te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP e te.TransformerLayer, são examinados. Uma receita FP8 de escala atrasada é configurada com formatos híbridos E4M3/E5M2 e histórico amax. Um modelo de linguagem causal compacto estilo GPT é construído usando blocos fundidos te.TransformerLayer, e um modelo equivalente puramente em PyTorch é implementado para comparação. O modelo é treinado em sequências sintéticas determinísticas de padrão aritmético, com autocast FP8 condicional quando suportado. O benchmark mede a latência média por passo e o pico de memória da GPU para os modos BF16 e FP8. Metadados FP8, incluindo fatores de escala e histórico amax, são inspecionados. Finalmente, a geração autoregressiva gulosa valida que o modelo aprende o passo aritmético, e extensões como modelos maiores e formatos FP8 alternativos são sugeridas.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas