AMD lança Instella-MoE-16B-A3B: um LLM de Mistura de Especialistas totalmente aberto com 2,8 bilhões de parâmetros ativos treinado em GPUs Instinct
A AMD apresentou o Instella-MoE-16B-A3B, um modelo de linguagem de Mistura de Especialistas totalmente aberto com 16 bilhões de parâmetros totais e 2,8 bilhões ativos por token, treinado do zero em GPUs Instinct MI300X e MI325X. O lançamento inclui pesos, misturas de dados, configurações de treinamento e código de inferência, com recursos inovadores como Atenção Multitítulo Latente com Portão e conectividade FarSkip-Collective.
A AMD lançou o Instella-MoE-16B-A3B, um modelo de linguagem de Mistura de Especialistas totalmente aberto, treinado do zero em GPUs Instinct MI300X e MI325X. O modelo tem 16 bilhões de parâmetros no total, mas ativa apenas 2,8 bilhões por token, usando 2 especialistas compartilhados e 6 especialistas roteados selecionados entre 64 por camada MoE. A AMD está publicando os pesos de cada etapa do treinamento, juntamente com as misturas de dados, configurações de treinamento e código de inferência. Duas escolhas estruturais-chave são a Atenção Latente de Múltiplas Cabeças com Portão (Gated Multi-head Latent Attention), que adiciona um portão de saída leve aprendido, e o FarSkip-Collective, que sobrepõe a comunicação paralela de especialistas com computação. A AMD relata um ganho de velocidade de pré-treinamento de 12,7% e uma redução de até 39,2% no tempo até o primeiro token ao servir com paralelismo de especialistas. O modelo foi pré-treinado em 7,1 trilhões de tokens de corpora abertos, com treinamento intermediário usando Dolma3 Dolmino 100B, e uma etapa de contexto longo que estende a janela de 4K para 64K usando YaRN. O pós-treinamento inclui SFT (Ajuste Fino Supervisionado), DPO (Otimização Direta de Preferências) e RL (Aprendizado por Reforço) no framework Miles. O checkpoint base tem média de 76,7, o mais forte entre os modelos totalmente abertos, à frente do Moonlight-16B-A3B (76,2) e outros. Os pesos estão sob a licença ResearchRAIL para fins acadêmicos e de pesquisa apenas, enquanto o código de treinamento é licenciado sob MIT.
Fonte: MarkTechPost —
original
