AliCloud: Zhenwu M890 Chip Successfully Adapted for Qwen3.8, Model Deployed on Bailian for Inference
Alibaba/Qwen
AliCloud announced that the Zhenwu M890 accelerator has been successfully adapted for the Qwen3.8 model (2.4 trillion parameters) and deployed on the Bailian platform for inference. This is China's first supernode capable of running a model with over 2 trillion parameters. The supernode uses 64 Zhenwu M890 chips with high-speed interconnect of 800 GB/s to support expert parallelism for the Mixture of Experts (MoE) model.
알리클라우드(AliCloud)는 슈퍼노드 젠우(Zhenwu) M890이 큐웬(Qwen)3.8(2.4조 매개변수) 모델에 성공적으로 적응되어 바이리안(Baillan) 플랫폼에서 추론 서비스를 제공하기 시작했다고 발표했다. 이는 중국 최초로 2조 개 이상의 매개변수를 가진 모델을 실행할 수 있는 슈퍼노드이다. 큐웬3.8은 알리바바의 플래그십 모델로 2.4조 개의 매개변수를 가지며, 수십 또는 수백 개의 고속 GPU에 매개변수를 분산해야 한다. 그러나 일반 AI 클러스터는 통신 대역폭 제한으로 인해 높은 처리량, 낮은 지연 시간 및 높은 병렬성을 제공할 수 없다. 젠우 M890은 핑터거우(Pingtouge)의 새로운 학습 및 추론 칩으로, FP32부터 FP4까지의 정밀도를 지원한다. 슈퍼노드는 64개의 젠우 M890 칩을 사용하며, ICN 스위치 1.0을 통해 고속 상호 연결하여 800GB/s를 달성하고 총 비디오 메모리는 9TB이다. 단일 인스턴스는 2조 개 매개변수의 MoE 모델에 대한 전문가 병렬 처리를 지원할 수 있다. 알리바바는 또한 칩에서 클라우드 플랫폼까지의 전체 체인을 큐웬에 맞게 최적화하여 큐웬3.8의 원활한 실행뿐만 아니라 추론 효율성을 높이고 비용을 절감했다. 테스트에 따르면, 연산자 최적화 및 하드웨어-소프트웨어 협업 덕분에 에이전틱(Agentic) 시나리오에서 추론 성능이 최대 1.5배까지 향상될 수 있다.
출처: QbitAI 量子位 —
원문
