AraştırmaModeller 🇨🇳 28.07.2026 16:03

Global-Batch Yük Dengesi: MoE LLM Eğitimini İyileştirmek İçin Neredeyse Bedava Öğle Yemeği

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen, Uzman Karışımı (MoE) modelleri için global-batch yük dengeleme yöntemi önermektedir. Bu yöntem, tüm mikro-partiler arasında uzman seçim sıklıklarını senkronize ederek mikro-parti seviyesindeki dengenin sınırlamalarını aşar. Deneyler, çeşitli model boyutları ve veri yapılandırmalarında iyileştirilmiş performans ve uzman uzmanlaşması göstermektedir.
Mixture-of-Experts (MoE) mimarisi, model parametrelerini ölçeklendirmek için popüler bir tekniktir, ancak Megatron-core gibi mevcut eğitim çerçeveleri, mikro-parti seviyesinde yük dengeleme kaybı kullanır ve bu, mikro-partiler homojen veri içerdiğinde (örneğin, yalnızca kod) performansı olumsuz etkileyebilir. Alibaba Qwen, global-parti denge kaybını tanıtarak tüm paralel gruplar arasında uzman seçim sıklığını senkronize eder ve kaybı global olarak hesaplar. Üç MoE konfigürasyonu (3.4B/0.6B aktif, 15B/2.54B aktif, 43B/6.6B aktif) ve 400B token'a kadar yapılan deneyler, global-parti dengesinin çeşitli görevlerde mikro-parti dengesinden sürekli olarak daha iyi performans gösterdiğini göstermektedir. Ayrıca, mikro-parti dengeli modellerde bulunmayan, uzmanların önemli ölçüde alan uzmanlaşmasına yol açar. Global kaybın üzerine küçük bir mikro-parti denge kaybı (ağırlık 0.01) eklemek, etkinliği etkilemeden eğitim hızını artırır. Yöntem neredeyse ücretsizdir çünkü senkronizasyon yalnızca uzman sayısına eşit boyutta bir vektör içerir. Çalışma, arXiv preprint 2501.11873'te yayımlanmıştır.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler