模型硬件与推理 🇺🇸 01.08.2026 23:02

AMD发布Instella-MoE-16B-A3B:一款完全开放、在Instinct GPU上训练、含28亿激活参数的专家混合大语言模型

AMD推出了Instella-MoE-16B-A3B,这是一款完全开放的专家混合语言模型,总参数达160亿,每个词元激活28亿参数,从头开始在Instinct MI300X和MI325X GPU上训练。此次发布包括权重、数据混合、训练配置和推理代码,并具有门控多头潜在注意力(Gated Multi-head Latent Attention)和FarSkip-Collective连接等创新特性。
AMD发布了Instella-MoE-16B-A3B,这是一个完全开放的混合专家语言模型,基于Instinct MI300X和MI325X GPU从头训练。该模型总参数量为160亿,但每个token仅激活28亿参数,每个MoE层使用2个共享专家和从64个中选出的6个路由专家。AMD发布了每个训练阶段的权重,以及数据混合、训练配置和推理代码。两个关键的结构选择是门控多头潜在注意力,它增加了一个轻量级的学习输出门,以及FarSkip-Collective,它将专家并行通信与计算重叠。AMD报告预训练速度提升12.7%,在使用专家并行服务时,首token时间最多减少39.2%。该模型在来自开放语料库的7.1万亿token上进行了预训练,使用Dolma3 Dolmino 100B进行中期训练,并通过YaRN将窗口从4K扩展到64K的长上下文阶段。后期训练包括在Miles框架中的监督微调、直接偏好优化和强化学习。基础检查点的平均分为76.7,在完全开放的模型中最强,领先于Moonlight-16B-A3B(76.2)等其他模型。权重在ResearchRAIL许可下仅供学术和研究目的使用,而训练代码库则采用MIT许可。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻