模型硬件与推理 🇺🇸 11.08.2026 08:03

Meta AI 发布 Muse Glimmer:适用于消费级 GPU 的 300 亿参数开放权重智能体模型

MetaMeta Alibaba/QwenAlibaba/Qwen
Meta 发布了 Muse Glimmer,这是一个从 Muse Spark 蒸馏而来的 300 亿参数多模态模型,采用 Apache 2.0 许可证。通过 4 比特量化(4-bit quantization)和 DFlash 投机解码(speculative decoding),它可以在单个消费级 GPU 或 Mac 上运行,支持本地智能体工作流。
Meta发布了Muse Glimmer,这是一个300亿参数的多模态模型,从Muse Spark蒸馏而来,针对常驻本地代理工作流进行了调优,并以Apache 2.0许可证发布。在全精度下,300亿参数的模型需要超过55GB的内存,但Meta将其压缩到大约4比特精度,并增加了块级投机解码,使其能够在单个消费级GPU或Mac上运行,无需网络调用。Hugging Face集合包含BF16权重、GGUF k-quants、ExecuTorch构建以及DFlash草稿模型。Muse Glimmer是一个具有感知编码器的密集因果Transformer,使用分组查询注意力,具有32个查询头和2个KV头,上下文长度超过131072。训练过程包括对Muse Spark输出的logit蒸馏,使用长上下文代理密集型数据进行中期训练,以及使用监督微调和强化学习进行后期训练。压缩版本的语言模型占用不到20GB,适合24GB或32GB的内存容量。提供了两种量化构建:K-Quant-Dynamic针对32GB显存,平均退化0.2%;K-Quant-17GB针对24GB显存,退化1.0%。DFlash是一种块扩散草稿模型,一次前向传播预测16个token,在RTX 5090上实现了3.1倍的加速。基准测试显示,Muse Glimmer在MCP Atlas(75.5)、DeepSearch QA(74.6)、Gaia2(43.3)、SWE-Bench Pro(51.2)和AIME 2026(94.7)上领先,但在OSWorld-Verified(65.9对75.6)和TerminalBench 2.1上落后于Qwen3.6-27B。在安全性方面,Siren AgentDojo攻击成功率为28.4,实用性为94.2,Meta将化学/生物、网络和失控风险评为中等或更低。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻