Bereitstellung von Kimi K3 auf AWS
Moonshot AI
NVIDIA
Moonshot AI hat Kimi K3 veröffentlicht, ein Open-Weight-MoE-Modell mit 2,8 Billionen Parametern. Der AWS-Blogbeitrag beschreibt die Bereitstellung auf SageMaker HyperPod oder Amazon EKS mit p6-b300-Instanzen, NVIDIA B300 Blackwell Ultra GPUs, vLLM-Serving und MXFP4-Quantisierung.
Am 27. Juli 2026 veröffentlichte Moonshot AI Kimi K3, ein 2,8 Billionen Parameter umfassendes Mixture-of-Experts-Modell (MoE) mit offenen Gewichten. Es nutzt Architekturinnovationen wie Kimi Delta Attention und Gated Multi Head Latent Attention und aktiviert 16 von 896 Experten pro Token (104 Milliarden aktive Parameter). Das Modell unterstützt ein Kontextfenster von einer Million Token, native multimodale Eingaben (Text + Bild), Toolaufrufe und strukturierte Ausgaben. AWS bietet zwei Bereitstellungsoptionen: Amazon SageMaker HyperPod mit Inference Operator, der die Orchestrierung abstrahiert, und ein selbstverwaltetes Amazon-EKS-Cluster mit EC2 Capacity Blocks. Beide erfordern p6-b300.48xlarge-Instanzen (8 NVIDIA B300 Blackwell Ultra GPUs). Die Gewichte sind im MXFP4-Format auf Hugging Face verfügbar, und vLLM wird als empfohlener Serving-Engine eingesetzt. Der Endpunkt stellt eine OpenAI-kompatible API bereit.
Quelle: AWS ML blog —
Original
