研究模型 🇨🇳 28.07.2026 16:03

全局批次负载均衡:提升MoE大模型训练的几乎免费午餐

Alibaba/QwenAlibaba/Qwen
阿里巴巴通义千问提出了一种用于混合专家(MoE)模型的全局批次负载均衡方法,该方法通过同步所有微批次中的专家选择频率,克服了微批次级别均衡的局限性。实验表明,在各种模型大小和数据配置下,该方法提升了性能并促进了专家专业化。
混合专家模型(MoE)架构是扩展模型参数的一种流行技术,但现有的训练框架(如Megatron-core)使用微批次级别的负载均衡损失,当微批次包含同质数据(例如仅代码)时可能会损害性能。阿里巴巴的Qwen引入了全局批次均衡损失,该损失同步所有并行组的专家选择频率并全局计算损失。使用三种MoE配置(激活参数3.4B/0.6B、15B/2.54B、43B/6.6B)并在多达4000亿个token上进行的实验表明,全局批次均衡在各种任务上始终优于微批次均衡。它还导致了专家的显著领域专业化,这在微批次均衡模型中是不存在的。在全局损失之上添加一个权重为0.01的小的微批次均衡损失可以提高训练速度,同时不影响效果。该方法几乎不增加额外成本,因为同步仅涉及一个大小等于专家数量的向量。该工作发表于arXiv预印本2501.11873。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻