RisetModel 🇨🇳 28.07.2026 16:03

Global-Batch Load Balance: Makan Siang Gratis untuk Meningkatkan Pelatihan MoE LLM

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen mengusulkan metode penyeimbangan beban global-batch untuk model Mixture-of-Experts (MoE), yang mengatasi keterbatasan keseimbangan level micro-batch dengan menyinkronkan frekuensi pemilihan ahli di seluruh micro-batch. Eksperimen menunjukkan peningkatan kinerja dan spesialisasi ahli di berbagai ukuran model dan konfigurasi data.
Arsitektur Mixture-of-Experts (MoE) merupakan teknik populer untuk meningkatkan skala parameter model, tetapi kerangka kerja pelatihan yang ada seperti Megatron-core menggunakan loss keseimbangan tingkat mikro-batch, yang dapat menurunkan kinerja ketika mikro-batch berisi data homogen (misalnya, hanya kode). Alibaba Qwen memperkenalkan loss keseimbangan global-batch, yang menyinkronkan frekuensi pemilihan pakar di semua grup paralel dan menghitung loss secara global. Eksperimen dengan tiga konfigurasi MoE (3,4M/0,6M teraktivasi, 15M/2,54M teraktivasi, 43M/6,6M teraktivasi) dan hingga 400 miliar token menunjukkan bahwa keseimbangan global-batch secara konsisten mengungguli keseimbangan mikro-batch pada berbagai tugas. Metode ini juga menghasilkan spesialisasi domain yang signifikan pada para pakar, yang tidak ada pada model keseimbangan mikro-batch. Menambahkan loss keseimbangan mikro-batch kecil (bobot 0,01) di atas loss global meningkatkan kecepatan pelatihan tanpa mempengaruhi efektivitas. Metode ini hampir gratis karena sinkronisasi hanya melibatkan vektor dengan ukuran yang sama dengan jumlah pakar. Karya ini telah dipublikasikan di pracetak arXiv 2501.11873.
Sumber: Alibaba Qwen — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru