Menyebarkan Kimi K3 di AWS
Moonshot AI
NVIDIA
Moonshot AI merilis Kimi K3, model MoE dengan 2,8 triliun parameter, bobot terbuka. Posting blog AWS menjelaskan penerapannya di SageMaker HyperPod atau Amazon EKS menggunakan instance p6-b300 dengan GPU NVIDIA B300 Blackwell Ultra, serving vLLM, dan kuantisasi MXFP4.
Pada 27 Juli 2026, Moonshot AI merilis Kimi K3, model Mixture of Experts (MoE) dengan 2,8 triliun parameter dan bobot terbuka. Model ini menggunakan inovasi arsitektur seperti Kimi Delta Attention dan Gated Multi Head Latent Attention, mengaktifkan 16 dari 896 ahli per token (104 miliar parameter aktif). Model ini mendukung jendela konteks 1 juta token, input multimodal asli (teks + visi), pemanggilan alat, dan keluaran terstruktur. AWS menawarkan dua opsi penerapan: Amazon SageMaker HyperPod dengan Inference Operator, yang mengabstraksi orkestrasi, serta klaster Amazon EKS yang dikelola sendiri menggunakan EC2 Capacity Blocks. Keduanya memerlukan instans p6-b300.48xlarge (8 GPU NVIDIA B300 Blackwell Ultra). Bobot tersedia dalam format MXFP4 di Hugging Face, dan vLLM adalah mesin penyajian yang direkomendasikan. Titik akhir mengekspos API yang kompatibel dengan OpenAI.
Sumber: AWS ML blog —
asli
