Menyebarkan Kimi K3 di Amazon SageMaker HyperPod dan Amazon EKS
Moonshot AI
vLLM
Amazon Web Services
Moonshot AI merilis Kimi K3, model terbuka dengan 2,8 triliun parameter, yang pertama dalam kelas 3 triliun. AWS menawarkan dua cara untuk menyebarkannya: SageMaker HyperPod dan Amazon EKS. Model ini membutuhkan instance GPU khusus p6-b300 dan menggunakan vLLM untuk inferensi.
Moonshot AI merilis model Kimi K3 dengan bobot terbuka yang memiliki 2,8 triliun parameter dan merupakan sistem terbuka pertama yang mencapai kelas 3 triliun parameter. Arsitekturnya mencakup Kimi Delta Attention, Gated Multi Head Latent Attention, dan Stable LatentMoE, mengaktifkan 16 dari 896 pakar per token, sehingga menghasilkan 104 miliar parameter aktif. Model ini mendukung konteks 1 juta token dan bersifat multimodal (teks dan gambar). Bobotnya tersedia di Hugging Face dalam format MXFP4, dan untuk inferensi disarankan menggunakan vLLM. Untuk penerapan, diperlukan instance p6-b300 dengan 8 GPU NVIDIA B300 Blackwell Ultra. AWS menawarkan dua cara: SageMaker HyperPod dengan Inference Operator dan Amazon EKS mandiri menggunakan Capacity Blocks. Kedua cara tersebut menyediakan API yang kompatibel dengan OpenAI untuk pemanggilan. Artikel ini berisi langkah-langkah terperinci untuk setiap opsi, termasuk pembuatan kluster, reservasi kapasitas, instalasi driver, dan penerapan vLLM, serta rekomendasi untuk membersihkan sumber daya.
Sumber: AWS ML blog —
asli
