AliCloud: Zhenwu M890 Chip Successfully Adapted for Qwen3.8, Model Deployed on Bailian for Inference
Alibaba/Qwen
AliCloud announced that the Zhenwu M890 accelerator has been successfully adapted for the Qwen3.8 model (2.4 trillion parameters) and deployed on the Bailian platform for inference. This is China's first supernode capable of running a model with over 2 trillion parameters. The supernode uses 64 Zhenwu M890 chips with high-speed interconnect of 800 GB/s to support expert parallelism for the Mixture of Experts (MoE) model.
AliCloud, Zhenwu M890 süper düğümünün Qwen3.8 (2,4 trilyon parametre) modeline başarıyla uyarlandığını ve Baillian platformunda çıkarım hizmetleri sunmak üzere kullanıma açıldığını duyurdu. Bu, 2 trilyon parametreden fazla model çalıştırabilen Çin'deki ilk süper düğüm. Qwen3.8, Alibaba'nın 2,4 trilyon parametreli amiral gemisi modeli olup çalışması için parametrelerin onlarca veya yüzlerce yüksek hızlı GPU'ya dağıtılmasını gerektiriyor. Ancak sıradan yapay zekâ kümeleri, iletişim bant genişliği kısıtlamaları nedeniyle yüksek verim, düşük gecikme ve yüksek paralellik sağlayamıyor. Zhenwu M890, Pingtouge'un FP32'den FP4'e kadar hassasiyeti destekleyen yeni eğitim ve çıkarım çipi. Süper düğüm, ICN Switch 1.0 üzerinden yüksek hızlı bağlantıyla 64 adet Zhenwu M890 çipi kullanarak 800 GB/s hıza ve 9 TB toplam video belleğine ulaşıyor. Tek bir örnek, 2 trilyon parametreli MoE modeli için uzman paralelliğini destekleyebiliyor. Alibaba ayrıca Qwen için çipten bulut platformuna kadar tüm zinciri optimize ederek yalnızca Qwen3.8'in sorunsuz çalışmasını sağlamakla kalmıyor, aynı zamanda çıkarım verimliliğini artırıp maliyetleri düşürüyor. Testler, operatör optimizasyonu ve donanım-yazılım ortak çalışması sayesinde Agentic senaryolarında çıkarım performansının 1,5 kata kadar artırılabildiğini gösteriyor.
Kaynak: QbitAI 量子位 —
orijinal
