ModelleHardware & Inferenz 🇺🇸 01.08.2026 23:02

AMD veröffentlicht Instella-MoE-16B-A3B: Ein vollständig offenes Mixture-of-Experts-Sprachmodell mit 2,8 Milliarden aktiven Parametern, trainiert auf Instinct-GPUs

AMD hat Instella-MoE-16B-A3B eingeführt, ein vollständig offenes Mixture-of-Experts-Sprachmodell mit insgesamt 16 Milliarden Parametern und 2,8 Milliarden aktiven Parametern pro Token, das von Grund auf auf Instinct MI300X- und MI325X-GPUs trainiert wurde. Die Veröffentlichung umfasst Gewichte, Datenmischungen, Trainingskonfigurationen und Inferenzcode mit innovativen Funktionen wie Gated Multi-head Latent Attention und FarSkip-Collective-Konnektivität.
AMD hat Instella-MoE-16B-A3B veröffentlicht, ein vollständig offenes Sprachmodell mit Mixture-of-Experts-Architektur, das von Grund auf auf Instinct-MI300X- und MI325X-GPUs trainiert wurde. Das Modell hat insgesamt 16 Milliarden Parameter, aktiviert aber nur 2,8 Milliarden pro Token und verwendet dabei 2 gemeinsame Experten sowie 6 geroutete Experten, die aus 64 pro MoE-Schicht ausgewählt werden. AMD veröffentlicht die Gewichte aus jeder Trainingsphase sowie Datenmischungen, Trainingskonfigurationen und Inferenzcode. Zwei zentrale strukturelle Entscheidungen sind Gated Multi-head Latent Attention, das ein leichtgewichtiges, gelerntes Ausgabegatter hinzufügt, und FarSkip-Collective, das die Experten-parallele Kommunikation mit der Berechnung überlappt. AMD berichtet von einer Beschleunigung des Vortrainings um 12,7 % und einer Reduzierung der Zeit bis zum ersten Token um bis zu 39,2 % bei der Inferenz mit Expertenparallelität. Das Modell wurde auf 7,1 Billionen Token aus offenen Korpora vortrainiert, wobei die mittlere Trainingsphase Dolma3 Dolmino 100B verwendete, und eine Langkontext-Phase erweiterte das Fenster von 4K auf 64K mithilfe von YaRN. Das Post-Training umfasst SFT, DPO und RL im Miles-Framework. Der Basis-Checkpoint erreicht einen Durchschnittswert von 76,7 und ist damit der stärkste unter vollständig offenen Modellen, vor Moonlight-16B-A3B (76,2) und anderen. Die Gewichte stehen unter einer ResearchRAIL-Lizenz nur für akademische und Forschungszwecke zur Verfügung, während der Trainingscode unter der MIT-Lizenz veröffentlicht wird.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten