Cân bằng tải toàn cục theo lô: 'Bữa trưa miễn phí' để cải thiện huấn luyện MoE LLM
Alibaba/Qwen
Alibaba Qwen đề xuất phương pháp cân bằng tải toàn cục theo lô cho mô hình Hỗn hợp chuyên gia (Mixture-of-Experts - MoE), khắc phục hạn chế của cân bằng ở cấp độ vi lô bằng cách đồng bộ hóa tần suất chọn chuyên gia trên tất cả các vi lô. Thử nghiệm cho thấy hiệu suất được cải thiện và chuyên môn hóa chuyên gia tốt hơn trên nhiều kích thước mô hình và cấu hình dữ liệu khác nhau.
Kiến trúc Mixture-of-Experts (MoE) là một kỹ thuật phổ biến để mở rộng tham số mô hình, nhưng các framework huấn luyện hiện có như Megatron-core sử dụng hàm mất cân bằng tải ở mức micro-batch, có thể làm giảm hiệu suất khi micro-batch chứa dữ liệu đồng nhất (ví dụ: chỉ mã code). Alibaba Qwen giới thiệu hàm mất cân bằng toàn bộ batch (global-batch balance loss), đồng bộ hóa tần suất chọn chuyên gia trên tất cả các nhóm song song và tính toán hàm mất mát một cách toàn cục. Các thử nghiệm với ba cấu hình MoE (kích hoạt 3,4B/0,6B, kích hoạt 15B/2,54B, kích hoạt 43B/6,6B) và lên đến 400 tỷ token cho thấy cân bằng toàn bộ batch luôn vượt trội so với cân bằng micro-batch trên nhiều tác vụ khác nhau. Phương pháp này cũng dẫn đến sự chuyên môn hóa lĩnh vực rõ rệt của các chuyên gia, điều mà các mô hình cân bằng micro-batch không có. Việc thêm một hàm mất cân bằng micro-batch nhỏ (trọng số 0,01) lên trên hàm mất toàn cục cải thiện tốc độ huấn luyện mà không ảnh hưởng đến hiệu quả. Phương pháp này gần như miễn phí vì việc đồng bộ chỉ liên quan đến một vector có kích thước bằng số lượng chuyên gia. Công trình được công bố trên bản in trước arXiv số 2501.11873.
Nguồn: Alibaba Qwen —
bản gốc
