Phần cứng & Suy luậnMô hình 🇨🇳 24.07.2026 01:03

AliCloud: Zhenwu M890 Chip Successfully Adapted for Qwen3.8, Model Deployed on Bailian for Inference

Alibaba/QwenAlibaba/Qwen
AliCloud announced that the Zhenwu M890 accelerator has been successfully adapted for the Qwen3.8 model (2.4 trillion parameters) and deployed on the Bailian platform for inference. This is China's first supernode capable of running a model with over 2 trillion parameters. The supernode uses 64 Zhenwu M890 chips with high-speed interconnect of 800 GB/s to support expert parallelism for the Mixture of Experts (MoE) model.
AliCloud thông báo rằng siêu nút Zhenwu M890 đã được thích ứng thành công với mô hình Qwen3.8 (2,4 nghìn tỷ tham số) và đưa vào vận hành trên nền tảng Baillian để cung cấp dịch vụ suy luận. Đây là siêu nút đầu tiên tại Trung Quốc có khả năng chạy được mô hình với hơn 2 nghìn tỷ tham số. Qwen3.8 là mô hình chủ lực của Alibaba với 2,4 nghìn tỷ tham số, yêu cầu phân phối tham số trên hàng chục hoặc hàng trăm GPU tốc độ cao. Tuy nhiên, các cụm AI thông thường không thể đảm bảo băng thông cao, độ trễ thấp và song song cao do giới hạn của băng thông liên lạc. Zhenwu M890 là chip mới dành cho huấn luyện và suy luận của Pingtouge, hỗ trợ độ chính xác từ FP32 đến FP4. Siêu nút sử dụng 64 chip Zhenwu M890 với kết nối tốc độ cao qua ICN Switch 1.0, đạt băng thông 800 GB/s, tổng bộ nhớ video 9 TB. Một phiên bản duy nhất có thể hỗ trợ song song chuyên gia cho mô hình MoE với 2 nghìn tỷ tham số. Alibaba cũng đã tiến hành tối ưu hóa toàn diện chuỗi từ chip đến nền tảng đám mây cho Qwen, không chỉ giúp vận hành trơn tru Qwen3.8 mà còn nâng cao hiệu quả suy luận và giảm chi phí. Các thử nghiệm cho thấy, nhờ tối ưu hóa toán tử và phối hợp phần cứng-phần mềm, hiệu suất suy luận trong các kịch bản Agentic có thể tăng lên đến 1,5 lần.
Nguồn: QbitAI 量子位 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới