Triển khai Kimi K3 trên Amazon SageMaker HyperPod và Amazon EKS
Moonshot AI
vLLM
Amazon Web Services
Moonshot AI đã phát hành Kimi K3 – mô hình mở với 2,8 nghìn tỷ tham số, là mô hình đầu tiên trong phân khúc 3 nghìn tỷ. AWS cung cấp hai cách triển khai: SageMaker HyperPod và Amazon EKS. Mô hình yêu cầu các instance GPU chuyên dụng p6-b300 và sử dụng vLLM cho quá trình suy luận.
Moonshot AI đã phát hành mô hình Kimi K3 với trọng số mở, có 2,8 nghìn tỷ tham số và là hệ thống mở đầu tiên đạt đến cấp độ 3 nghìn tỷ tham số. Kiến trúc bao gồm Kimi Delta Attention, Gated Multi Head Latent Attention và Stable LatentMoE, kích hoạt 16 trong số 896 chuyên gia trên mỗi token, cung cấp 104 tỷ tham số hoạt động. Mô hình hỗ trợ ngữ cảnh lên đến 1 triệu token và đa phương thức (văn bản và hình ảnh). Trọng số có sẵn trên Hugging Face ở định dạng MXFP4, để suy luận nên sử dụng vLLM. Để triển khai, cần các phiên bản p6-b300 với 8 GPU NVIDIA B300 Blackwell Ultra. AWS cung cấp hai cách: SageMaker HyperPod với Inference Operator và Amazon EKS độc lập sử dụng Capacity Blocks. Cả hai cách đều đảm bảo API tương thích OpenAI cho các lệnh gọi. Bài viết bao gồm các bước chi tiết cho từng tùy chọn, bao gồm tạo cụm, đặt trước dung lượng, cài đặt trình điều khiển và triển khai vLLM, cũng như các khuyến nghị về việc dọn dẹp tài nguyên.
Nguồn: AWS ML blog —
bản gốc
