Phần cứng & Suy luận 🇺🇸 02.08.2026 11:02

Tăng tốc huấn luyện Transformer với NVIDIA Transformer Engine, Kernel hợp nhất, BF16, FP8 và đánh giá hiệu năng GPU

NVIDIANVIDIA
Hướng dẫn này khám phá cách NVIDIA Transformer Engine tăng tốc các tác vụ transformer bằng cách kết hợp kernel GPU hợp nhất, tính toán BF16 và thực thi FP8 nhận biết phần cứng. Nội dung bao gồm cài đặt, phát hiện GPU, tham quan mô-đun, cấu hình công thức FP8, huấn luyện mô hình, đánh giá hiệu năng và sinh tự hồi quy.
Hướng dẫn bắt đầu bằng việc cài đặt NVIDIA Transformer Engine và khởi tạo môi trường PyTorch. Nó phát hiện kiến trúc GPU để xác định xem có hỗ trợ các kernel TE và tensor core FP8 hay không, với phương án dự phòng hoàn toàn bằng PyTorch cho phần cứng không hỗ trợ. Các thành phần fused chính như te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP và te.TransformerLayer được xem xét. Một công thức FP8 scaling trễ được cấu hình với định dạng lai E4M3/E5M2 và lịch sử amax. Một mô hình ngôn ngữ nhân quả kiểu GPT nhỏ gọn được xây dựng bằng các khối te.TransformerLayer fused, và một mô hình tương đương hoàn toàn bằng PyTorch được triển khai để so sánh. Mô hình được huấn luyện trên các chuỗi mẫu số học nhân tạo xác định, với FP8 autocast có điều kiện khi được hỗ trợ. Đo điểm chuẩn đo độ trễ trung bình mỗi bước và bộ nhớ GPU cao nhất cho chế độ BF16 và FP8. Siêu dữ liệu FP8, bao gồm hệ số scaling và lịch sử amax, được kiểm tra. Cuối cùng, quá trình sinh tự hồi quy tham lam xác nhận rằng mô hình học được bước số học, và các phần mở rộng như mô hình lớn hơn và định dạng FP8 thay thế được gợi ý.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới