モデルハードウェア・推論 🇺🇸 11.08.2026 08:03

Meta AI、コンシューマー向けGPU向け30Bオープンウェイトエージェントモデル「Muse Glimmer」を発表

MetaMeta Alibaba/QwenAlibaba/Qwen
Metaは、Apache 2.0ライセンスのもと、Muse Sparkから蒸留された300億パラメータのマルチモーダルモデル「Muse Glimmer」を公開しました。4ビット量子化とDFlash投機的デコードにより、単一のコンシューマー向けGPUまたはMacで動作し、ローカルでのエージェントワークフローを可能にします。
Metaは、Muse Sparkから蒸留された30億パラメータのマルチモーダルモデルであるMuse Glimmerをリリースしました。これは、常時稼働のローカルエージェントワークフロー向けに調整され、Apache 2.0ライセンスで公開されています。フル精度では、30Bモデルは55GB以上のメモリを必要としますが、Metaはそれを約4ビット精度に圧縮し、ブロックレベル投機的復号を追加することで、コンシューマー向けGPUまたはMac上でネットワークコールなしで実行できるようにしました。Hugging Faceコレクションには、BF16ウェイト、GGUF k-quants、ExecuTorchビルド、DFlashドラフターが含まれています。Muse Glimmerは、知覚エンコーダを備えた高密度因果トランスフォーマーで、32のクエリヘッドと2のKVヘッドを持つグループ化クエリアテンションを使用し、131,072以上のコンテキスト長を備えています。トレーニングでは、Muse Sparkの出力に対するロジット蒸留、長いコンテキストのエージェント中心データを用いた中間トレーニング、教師ありファインチューニングと強化学習によるポストトレーニングが行われました。圧縮版は言語モデルで20GB未満となり、24GBまたは32GBのメモリ容量に収まります。量子化ビルドは2種類用意されています:K-Quant-Dynamicは32GBのVRAMを対象とし、平均劣化0.2%、K-Quant-17GBは24GBのVRAMを対象とし、1.0%の劣化です。ブロック拡散ドラフターであるDFlashは、1回のフォワードパスで16トークンを予測し、RTX 5090で3.1倍の高速化を達成します。ベンチマークでは、Muse GlimmerはMCP Atlas(75.5)、DeepSearch QA(74.6)、Gaia2(43.3)、SWE-Bench Pro(51.2)、AIME 2026(94.7)でトップですが、OSWorld-Verified(65.9対75.6)とTerminalBench 2.1ではQwen3.6-27Bに劣ります。安全性については、Siren AgentDojoの攻撃成功率は28.4、ユーティリティは94.2であり、Metaは化学/生物、サイバー、および制御喪失リスクを中程度以下と評価しています。
出典: MarkTechPost — 原文
関連記事 ↓
新着ニュース