веса с каждого этапа обучения, а также смеси данных, конфигурации обучения и код для инференса. Два ключевых структурных решения — это Gated Multi-head Latent Attention, который добавляет легковесный обучаемый выходной гейт, и FarSkip-Collective, который перекрывает эксперт-параллельную коммуникацию с вычислениями. AMD сообщает о 12,7% ускорении предобучения и сокращении времени до первого токена до 39,2% при обслуживании с экспертным параллелизмом. Модель была предобучена на 7,1 триллиона токенов из открытых корпусов, с использованием Dolma3 Dolmino 100B на этапе промежуточного обучения, и этапом длинного контекста, расширяющим окно с 4 тысяч до 64 тысяч токенов с помощью YaRN. Пост-обучение включает SFT, DPO и RL в рамках инфраструктуры Miles. Базовый чекпоинт в среднем достигает 76,7 — это лучший показатель среди полностью открытых моделей, опережающий Moonlight-16B-A3B (76,2) и другие. Веса распространяются под лицензией ResearchRAIL только для академических и исследовательских целей, в то время как кодовые базы для обучения имеют лицензию MIT.