AMD выпускает Instella-MoE-16B-A3B: полностью открытая LLM со смешанными экспертами и 2,8 млрд активных параметров, обученная на GPU Instinct
AMD представила Instella-MoE-16B-A3B — полностью открытую языковую модель со смешанными экспертами (Mixture-of-Experts), имеющую 16 миллиардов параметров, из которых 2,8 миллиарда активны на каждый токен. Модель была обучена с нуля на графических процессорах Instinct MI300X и MI325X. Релиз включает веса, смеси данных, конфигурации обучения и код для инференса, а также инновационные функции, такие как Gated Multi-head Latent Attention и связность FarSkip-Collective.
MarkTechPost01.08 · 23:02
