ModelosHardware e Inferencia 🇺🇸 01.08.2026 23:02

AMD lanza Instella-MoE-16B-A3B: un modelo de lenguaje de mezcla de expertos totalmente abierto con 2.800 millones de parámetros activos entrenado en GPU Instinct

AMD presentó Instella-MoE-16B-A3B, un modelo de lenguaje de mezcla de expertos totalmente abierto con 16.000 millones de parámetros en total y 2.800 millones activos por token, entrenado desde cero en GPU Instinct MI300X y MI325X. El lanzamiento incluye pesos, mezclas de datos, configuraciones de entrenamiento y código de inferencia, con características innovadoras como la atención multi-cabezal latente con compuertas y la conectividad FarSkip-Coleccionista.
AMD ha lanzado Instella-MoE-16B-A3B, un modelo de lenguaje de Mezcla de Expertos totalmente abierto, entrenado desde cero en GPUs Instinct MI300X y MI325X. El modelo tiene 16 mil millones de parámetros en total, pero solo activa 2.8 mil millones por token, utilizando 2 expertos compartidos y 6 expertos enrutados seleccionados de 64 por capa de MoE. AMD está publicando los pesos de cada etapa de entrenamiento, junto con las mezclas de datos, configuraciones de entrenamiento y código de inferencia. Dos elecciones estructurales clave son la Atención Latente Multi-cabeza con Puerta (Gated Multi-head Latent Attention), que añade una puerta de salida aprendida y ligera, y FarSkip-Collective, que superpone la comunicación paralela de expertos con el cómputo. AMD reporta una aceleración del 12.7% en el preentrenamiento y una reducción de hasta el 39.2% en el tiempo hasta el primer token al servir con paralelismo de expertos. El modelo fue preentrenado con 7.1 billones de tokens de corpus abiertos, con una etapa intermedia usando Dolma3 Dolmino 100B, y una fase de contexto largo que extiende la ventana de 4K a 64K utilizando YaRN. El post-entrenamiento incluye SFT, DPO y RL en el marco Miles. El checkpoint base promedia 76.7, el más fuerte entre los modelos totalmente abiertos, por delante de Moonlight-16B-A3B (76.2) y otros. Los pesos están bajo una licencia ResearchRAIL para fines académicos y de investigación únicamente, mientras que el código de entrenamiento tiene licencia MIT.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas