Nghiên cứuMô hình 🇨🇳 28.07.2026 16:03

Cân Bằng Tải Toàn Cục Theo Batch: Cải Thiện Huấn Luyện MoE LLM Gần Như Miễn Phí

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen đề xuất phương pháp cân bằng tải toàn cục theo batch cho các mô hình Mixture-of-Experts (MoE), khắc phục hạn chế của cân bằng ở cấp micro-batch bằng cách đồng bộ hóa tần suất chọn chuyên gia trên tất cả các micro-batch. Các thử nghiệm cho thấy hiệu suất và khả năng chuyên môn hóa chuyên gia được cải thiện trên nhiều kích thước mô hình và cấu hình dữ liệu khác nhau.
Kiến trúc Mixture-of-Experts (MoE) là một kỹ thuật phổ biến để mở rộng tham số mô hình, nhưng các framework huấn luyện hiện có như Megatron-core sử dụng hàm mất cân bằng tải ở mức micro-batch, có thể làm giảm hiệu suất khi micro-batch chứa dữ liệu đồng nhất (ví dụ: chỉ mã code). Alibaba Qwen giới thiệu hàm mất cân bằng toàn bộ batch (global-batch balance loss), đồng bộ hóa tần suất chọn chuyên gia trên tất cả các nhóm song song và tính toán hàm mất mát một cách toàn cục. Các thử nghiệm với ba cấu hình MoE (kích hoạt 3,4B/0,6B, kích hoạt 15B/2,54B, kích hoạt 43B/6,6B) và lên đến 400 tỷ token cho thấy cân bằng toàn bộ batch luôn vượt trội so với cân bằng micro-batch trên nhiều tác vụ khác nhau. Phương pháp này cũng dẫn đến sự chuyên môn hóa lĩnh vực rõ rệt của các chuyên gia, điều mà các mô hình cân bằng micro-batch không có. Việc thêm một hàm mất cân bằng micro-batch nhỏ (trọng số 0,01) lên trên hàm mất toàn cục cải thiện tốc độ huấn luyện mà không ảnh hưởng đến hiệu quả. Phương pháp này gần như miễn phí vì việc đồng bộ chỉ liên quan đến một vector có kích thước bằng số lượng chuyên gia. Công trình được công bố trên bản in trước arXiv số 2501.11873.
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới