ModèlesMatériel et Inférence 🇺🇸 11.08.2026 08:03

Meta AI dévoile Muse Glimmer : un modèle agentique de 30 milliards de paramètres en open weight pour GPU grand public

MetaMeta Alibaba/QwenAlibaba/Qwen
Meta a publié Muse Glimmer, un modèle multimodal de 30 milliards de paramètres distillé à partir de Muse Spark, sous licence Apache 2.0. Grâce à la quantification 4 bits et au décodage spéculatif DFlash, il fonctionne sur une seule carte graphique grand public ou un Mac, permettant des workflows agentiques locaux.
Meta a dévoilé Muse Glimmer, un modèle multimodal de 30 milliards de paramètres distillé à partir de Muse Spark, optimisé pour des workflows agents locaux toujours actifs, et publié sous licence Apache 2.0. En pleine précision, un modèle de 30B nécessite plus de 55 Go de mémoire, mais Meta le compresse à environ 4 bits et ajoute un décodage spéculatif par blocs, ce qui lui permet de fonctionner sur un seul GPU grand public ou un Mac sans appel réseau. La collection Hugging Face comprend des poids BF16, des quantifications GGUF k-quants, des builds ExecuTorch et le drafter DFlash. Muse Glimmer est un transformateur causal dense avec un encodeur de perception, utilisant une attention par groupes de requêtes avec 32 têtes de requête et 2 têtes de clé/valeur, et une longueur de contexte de 131 072+ tokens. L'entraînement a impliqué une distillation logit sur les sorties de Muse Spark, un entraînement intermédiaire avec des données longues contextes axées agents, et un post-entraînement avec ajustement supervisé et apprentissage par renforcement. La version compressée prend moins de 20 Go pour le modèle de langage, ce qui tient dans des enveloppes de 24 Go ou 32 Go. Deux versions quantifiées sont disponibles : K-Quant-Dynamic cible 32 Go de VRAM avec une dégradation moyenne de 0,2 %, et K-Quant-17GB cible 24 Go de VRAM avec 1,0 %. DFlash, un drafter par diffusion de blocs, prédit 16 tokens en une seule passe avant, atteignant un facteur d'accélération de 3,1x sur RTX 5090. Les benchmarks montrent que Muse Glimmer est en tête sur MCP Atlas (75,5), DeepSearch QA (74,6), Gaia2 (43,3), SWE-Bench Pro (51,2) et AIME 2026 (94,7), mais est en retrait par rapport à Qwen3.6-27B sur OSWorld-Verified (65,9 contre 75,6) et TerminalBench 2.1. En matière de sécurité, le taux de réussite des attaques Siren AgentDojo est de 28,4 avec une utilité de 94,2, et Meta évalue les risques chimiques/biologiques, cyber et de perte de contrôle comme modérés ou inférieurs.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches