ForschungModelle 🇨🇳 28.07.2026 16:03

Global-Batch-Lastverteilung: Fast kostenloses Mittagessen zur Verbesserung des MoE-LLM-Trainings

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen schlägt eine Global-Batch-Lastverteilungsmethode für Mixture-of-Experts (MoE)-Modelle vor, die die Einschränkungen der Mikrobatch-Ebene überwindet, indem die Häufigkeiten der Expertenauswahl über alle Mikrobatches hinweg synchronisiert werden. Experimente zeigen verbesserte Leistung und Spezialisierung der Experten in verschiedenen Modellgrößen und Datenkonfigurationen.
Die Mixture-of-Experts (MoE)-Architektur ist eine beliebte Technik zur Skalierung von Modellparametern, aber bestehende Trainings-Frameworks wie Megatron-core verwenden einen Load-Balancing-Verlust auf Mikro-Batch-Ebene, der die Leistung beeinträchtigen kann, wenn Mikro-Batches homogene Daten enthalten (z. B. nur Code). Alibaba Qwen führt einen Global-Batch-Balance-Verlust ein, der die Expertenauswahlhäufigkeit über alle parallelen Gruppen hinweg synchronisiert und den Verlust global berechnet. Experimente mit drei MoE-Konfigurationen (3,4B/0,6B aktiviert, 15B/2,54B aktiviert, 43B/6,6B aktiviert) und bis zu 400B Token zeigen, dass die Global-Batch-Balance bei verschiedenen Aufgaben durchgängig besser abschneidet als die Mikro-Batch-Balance. Sie führt auch zu einer signifikanten Domänenspezialisierung der Experten, die bei Mikro-Batch-balancierten Modellen fehlt. Das Hinzufügen eines kleinen Mikro-Batch-Balance-Verlustes (Gewicht 0,01) zusätzlich zum globalen Verlust verbessert die Trainingsgeschwindigkeit, ohne die Effektivität zu beeinträchtigen. Die Methode ist nahezu kostenlos, da die Synchronisation nur einen Vektor umfasst, dessen Größe der Anzahl der Experten entspricht. Die Arbeit wurde im arXiv-Preprint 2501.11873 veröffentlicht.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten