全局批次负载均衡:提升MoE大模型训练的几乎免费午餐
阿里巴巴通义千问提出了一种用于混合专家(MoE)模型的全局批次负载均衡方法,该方法通过同步所有微批次中的专家选择频率,克服了微批次级别均衡的局限性。实验表明,在各种模型大小和数据配置下,该方法提升了性能并促进了专家专业化。
Alibaba/Qwen
Alibaba Qwen28.07 · 16:03
阿里巴巴通义千问提出了一种用于混合专家(MoE)模型的全局批次负载均衡方法,该方法通过同步所有微批次中的专家选择频率,克服了微批次级别均衡的局限性。实验表明,在各种模型大小和数据配置下,该方法提升了性能并促进了专家专业化。
Alibaba/Qwen
阿里巴巴推出了 Qwen2.5-VL,新一代视觉语言模型,提供 3B、7B 和 72B 三种规模。该模型在视觉理解方面有所改进,支持超过一小时的视频,具备代理操作能力和结构化输出功能。
Alibaba/Qwen