ModèlesMatériel et Inférence 🇺🇸 01.08.2026 23:02

AMD lance Instella-MoE-16B-A3B : un LLM à mélange d'experts entièrement ouvert avec 2,8 milliards de paramètres actifs entraîné sur des GPU Instinct

AMD a présenté Instella-MoE-16B-A3B, un modèle de langage à mélange d'experts entièrement ouvert avec 16 milliards de paramètres au total et 2,8 milliards de paramètres actifs par jeton, entraîné de zéro sur des GPU Instinct MI300X et MI325X. La publication comprend les poids, les mélanges de données, les configurations d'entraînement et le code d'inférence, avec des fonctionnalités innovantes telles que l'attention multi-têtes latente à portes et la connectivité FarSkip-Collective.
AMD a publié Instella-MoE-16B-A3B, un modèle de langage à mélange d'experts entièrement ouvert, entraîné de zéro sur les GPU Instinct MI300X et MI325X. Le modèle compte 16 milliards de paramètres au total, mais n'en active que 2,8 milliards par jeton, en utilisant 2 experts partagés et 6 experts routés sélectionnés parmi 64 par couche MoE. AMD publie les poids de chaque étape d'entraînement, ainsi que les mélanges de données, les configurations d'entraînement et le code d'inférence. Deux choix structurels clés sont l'attention latente multi-têtes avec porte (Gated Multi-head Latent Attention), qui ajoute une porte de sortie apprise légère, et FarSkip-Collective, qui chevauche la communication entre experts parallèles avec le calcul. AMD rapporte une accélération de 12,7 % du pré-entraînement et une réduction allant jusqu'à 39,2 % du temps jusqu'au premier jeton lors du service avec parallélisme des experts. Le modèle a été pré-entraîné sur 7,1 billions de jetons provenant de corpus ouverts, avec un entraînement intermédiaire utilisant Dolma3 Dolmino 100B, et une étape de long contexte étendant la fenêtre de 4K à 64K en utilisant YaRN. Le post-entraînement comprend SFT, DPO et RL dans le cadre Miles. Le point de contrôle de base atteint en moyenne 76,7, le plus élevé parmi les modèles entièrement ouverts, devant Moonlight-16B-A3B (76,2) et d'autres. Les poids sont sous licence ResearchRAIL à des fins académiques et de recherche uniquement, tandis que le code d'entraînement est sous licence MIT.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches