AMD выпускает Instella-MoE-16B-A3B: полностью открытая LLM со смешанными экспертами и 2,8 млрд активных параметров, обученная на GPU Instinct

AMD представила Instella-MoE-16B-A3B — полностью открытую языковую модель со смешанными экспертами (Mixture-of-Experts), имеющую 16 миллиардов параметров, из которых 2,8 миллиарда активны на каждый токен. Модель была обучена с нуля на графических процессорах Instinct MI300X и MI325X. Релиз включает веса, смеси данных, конфигурации обучения и код для инференса, а также инновационные функции, такие как Gated Multi-head Latent Attention и связность FarSkip-Collective.
AMD выпустила Instella-MoE-16B-A3B — полностью открытую языковую модель со смешанными экспертами (Mixture-of-Experts), обученную с нуля на графических процессорах Instinct MI300X и MI325X. Модель имеет 16 миллиардов общих параметров, но активирует только 2,8 миллиарда на каждый токен, используя 2 общих эксперта и 6 маршрутизируемых экспертов, выбираемых из 64 на каждом слое MoE. AMD публикует
Показать ещё ↓
Источник: MarkTechPost — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости