Kimi K3:n käyttöönotto AWS:ssä
Moonshot AI
NVIDIA
Moonshot AI julkaisi Kimi K3:n, 2,8 biljoonan parametrin MoE-mallin, avoimella painoilla. AWS:n blogikirjoitus kuvaa sen käyttöönottoa SageMaker HyperPodissa tai Amazon EKS:ssä käyttäen p6-b300-instansseja NVIDIA B300 Blackwell Ultra GPU:illa, vLLM-palvelua ja MXFP4-kvantisointia.
26. heinäkuuta 2026 Moonshot AI julkaisi Kimi K3 -mallin, joka on 2,8 biljoonan parametrin asiantuntijasekoitusmalli (eli Mixture of Experts, MoE) avoimilla painoilla. Se hyödyntää arkkitehtuuri-innovaatioita, kuten Kimi Delta Attentionia ja Gated Multi Head Latent Attentionia, aktivoimalla 16 asiantuntijaa 896:sta tokenia kohti (104 miljardia aktiivista parametria). Malli tukee miljoonan tokenin konteksti-ikkunaa, natiivia multimodaalista syötettä (teksti + kuva), työkalujen käyttöä (tool calling) ja jäsenneltyä tuotosta. AWS tarjoaa kaksi käyttöönottovaihtoehtoa: Amazon SageMaker HyperPod Inference Operatorilla, joka abstrahoi orkestroinnin, ja itsehallinnoidun Amazon EKS -klusterin käyttäen EC2 Capacity Blockseja. Molemmat vaativat p6-b300.48xlarge-instansseja (8 NVIDIA B300 Blackwell Ultra -grafiikkasuoritinta). Painot ovat saatavilla MXFP4-muodossa Hugging Facessa, ja vLLM on suositeltu palvelumoottori. Päätepiste tarjoaa OpenAI-yhteensopivan rajapinnan.
Lähde: AWS ML blog —
Alkuperäinen
