모델하드웨어 및 추론 🇺🇸 01.08.2026 23:02

AMD, Instella-MoE-16B-A3B 공개: Instinct GPU로 학습된 완전 공개 Mixture-of-Experts LLM, 활성 파라미터 28억 개

AMD가 인스트라-MoE-16B-A3B를 공개했다. 이는 총 160억 개의 파라미터와 토큰당 28억 개의 활성 파라미터를 가진 완전 공개 Mixture-of-Experts 언어 모델로, Instinct MI300X 및 MI325X GPU에서 처음부터 학습되었다. 이번 릴리스에는 가중치, 데이터 혼합, 학습 설정, 추론 코드가 포함되며, Gated Multi-head Latent Attention과 FarSkip-Collective 연결과 같은 혁신적인 기능을 갖추고 있다.
AMD는 Instinct MI300X 및 MI325X GPU에서 처음부터 훈련된 완전 개방형 Mixture-of-Experts 언어 모델인 Instella-MoE-16B-A3B를 출시했습니다. 이 모델은 총 160억 개의 파라미터를 가지고 있지만 토큰당 28억 개만 활성화하며, MoE 계층당 64개 중에서 선택된 2개의 공유 전문가와 6개의 라우팅 전문가를 사용합니다. AMD는 각 훈련 단계의 가중치를 데이터 혼합, 훈련 구성 및 추론 코드와 함께 공개하고 있습니다. 두 가지 주요 구조적 선택은 가벼운 학습된 출력 게이트를 추가하는 Gated Multi-head Latent Attention과 전문가 병렬 통신과 계산을 겹치는 FarSkip-Collective입니다. AMD는 사전 훈련 속도가 12.7% 향상되었고, 전문가 병렬로 서빙할 때 첫 토큰까지의 시간이 최대 39.2% 단축되었다고 보고합니다. 이 모델은 오픈 코퍼스에서 7.1조 토큰으로 사전 훈련되었으며, 중간 훈련에는 Dolma3 Dolmino 100B를 사용하고, YaRN을 사용하여 컨텍스트 창을 4K에서 64K로 확장하는 긴 컨텍스트 단계를 거쳤습니다. 사후 훈련에는 Miles 프레임워크에서 SFT(Supervised Fine-Tuning), DPO(Direct Preference Optimization) 및 RL(Reinforcement Learning)이 포함됩니다. 기본 체크포인트는 평균 76.7로 완전 개방형 모델 중 가장 강력하며, Moonlight-16B-A3B(76.2) 등을 능가합니다. 가중치는 학술 및 연구 목적으로만 ResearchRAIL 라이선스 하에 있으며, 훈련 코드베이스는 MIT 라이선스입니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스