AMD brengt Instella-MoE-16B-A3B uit: een volledig open Mixture-of-Experts-taalmodel met 2,8 miljard actieve parameters, getraind op Instinct-GPU's
AMD heeft Instella-MoE-16B-A3B geïntroduceerd, een volledig open Mixture-of-Experts-taalmodel met in totaal 16 miljard parameters en 2,8 miljard actieve parameters per token, helemaal opnieuw getraind op Instinct MI300X- en MI325X-GPU's. De release omvat gewichten, datamengsels, trainingconfiguraties en inferentiecode, met innovatieve functies zoals Gated Multi-head Latent Attention en FarSkip-Collective-connectiviteit.
AMD heeft Instella-MoE-16B-A3B uitgebracht, een volledig open Mixture-of-Experts-taalmodel dat vanaf nul is getraind op Instinct MI300X- en MI325X-GPU's. Het model heeft in totaal 16 miljard parameters, maar activeert slechts 2,8 miljard per token, met gebruik van 2 gedeelde experts en 6 gerouteerde experts geselecteerd uit 64 per MoE-laag. AMD publiceert gewichten van elke trainingsfase, samen met datamengsels, trainingsconfiguraties en inferentiecode. Twee belangrijke structurele keuzes zijn Gated Multi-head Latent Attention, dat een lichtgewicht aangeleerde uitvoergate toevoegt, en FarSkip-Collective, dat expert-parallelle communicatie overlapt met berekening. AMD rapporteert een 12,7% versnelling in de pre-training en een vermindering van de time-to-first-token met tot 39,2% bij het serveren met expert-parallelisme. Het model is voorgetraind op 7,1 biljoen tokens uit open corpora, met een mid-training fase die gebruikmaakt van Dolma3 Dolmino 100B, en een lange-contextfase die het venster uitbreidt van 4K naar 64K met behulp van YaRN. Na de training omvat het proces SFT, DPO en RL in het Miles-framework. Het basis checkpoint behaalt een gemiddelde van 76,7, het hoogste onder volledig open modellen, en overtreft Moonlight-16B-A3B (76,2) en anderen. De gewichten vallen onder een ResearchRAIL-licentie, uitsluitend voor academische en onderzoeksdoeleinden, terwijl de trainingscode onder de MIT-licentie valt.
Bron: MarkTechPost —
origineel
