Keseimbangan Beban Global-Batch: Hampir Makan Siang Gratis untuk Meningkatkan Pelatihan MoE LLM
Alibaba/Qwen
Alibaba Qwen mengusulkan metode keseimbangan beban global-batch untuk model Mixture-of-Experts (MoE), yang mengatasi keterbatasan keseimbangan tingkat micro-batch dengan menyinkronkan frekuensi pemilihan ahli di semua micro-batch. Eksperimen menunjukkan peningkatan kinerja dan spesialisasi ahli di berbagai ukuran model dan konfigurasi data.
Arsitektur Mixture-of-Experts (MoE) merupakan teknik populer untuk meningkatkan skala parameter model, tetapi kerangka kerja pelatihan yang ada seperti Megatron-core menggunakan loss keseimbangan tingkat mikro-batch, yang dapat menurunkan kinerja ketika mikro-batch berisi data homogen (misalnya, hanya kode). Alibaba Qwen memperkenalkan loss keseimbangan global-batch, yang menyinkronkan frekuensi pemilihan pakar di semua grup paralel dan menghitung loss secara global. Eksperimen dengan tiga konfigurasi MoE (3,4M/0,6M teraktivasi, 15M/2,54M teraktivasi, 43M/6,6M teraktivasi) dan hingga 400 miliar token menunjukkan bahwa keseimbangan global-batch secara konsisten mengungguli keseimbangan mikro-batch pada berbagai tugas. Metode ini juga menghasilkan spesialisasi domain yang signifikan pada para pakar, yang tidak ada pada model keseimbangan mikro-batch. Menambahkan loss keseimbangan mikro-batch kecil (bobot 0,01) di atas loss global meningkatkan kecepatan pelatihan tanpa mempengaruhi efektivitas. Metode ini hampir gratis karena sinkronisasi hanya melibatkan vektor dengan ukuran yang sama dengan jumlah pakar. Karya ini telah dipublikasikan di pracetak arXiv 2501.11873.
Sumber: Alibaba Qwen —
asli
