Nghiên cứuMô hình 🇷🇺 11.08.2026 00:02

Mở rộng quy mô huấn luyện LLM: Từ một con chip đến trung tâm dữ liệu. Chương 4: Huấn luyện Transformer

Chương này xem xét bốn loại song song hóa để huấn luyện transformer trên nhiều bộ tăng tốc: song song dữ liệu, song song dữ liệu phân mảnh hoàn toàn (FSDP), song song tensor và song song pipeline. Chương thảo luận về ưu điểm, nhược điểm và thời điểm kết hợp chúng, nhấn mạnh tầm quan trọng của việc đạt được hiệu suất tính toán-bị ràng buộc cho khả năng mở rộng quy mô.
Bài viết giải thích cách huấn luyện một mô hình transformer một cách hiệu quả và ở quy mô lớn. Bài viết giới thiệu các ký hiệu cho kích thước mô hình (D, F, B, T, L) và phần cứng (C, W, X, Y, Z). Bốn loại song song được mô tả: song song dữ liệu phân chia batch trên các bộ tăng tốc, yêu cầu AllReduce để tổng hợp gradient, và hiệu quả khi mô hình vừa với một bộ tăng tốc. FSDP (ZeRO) phân mảnh trọng số mô hình, gradient và trạng thái optimizer, sử dụng AllGather và ReduceScatter, và bị giới hạn bởi tính toán khi kích thước batch nhỏ. Song song tensor phân mảnh ma trận trọng số, trao đổi activation, và tốt nhất khi kết hợp với FSDP để giảm kích thước activation so với trọng số. Song song pipeline phân chia mô hình theo các lớp, giảm thiểu truyền dữ liệu nhưng tạo ra 'bong bóng pipeline', có thể được giảm bớt bằng microbatching hoặc chồng lấp tính toán. Bài viết lưu ý rằng sự kết hợp FSDP+TP hầu như luôn bị giới hạn bởi tính toán, và pipelining phổ biến cho các cụm GPU. Kết luận rằng mục tiêu là mở rộng quy mô trong khi quản lý chi phí.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới