Kimi K3 implementeren op AWS
Moonshot AI
NVIDIA
Moonshot AI heeft Kimi K3 uitgebracht, een MoE-model met 2,8 biljoen parameters en open gewichten. De AWS-blogpost beschrijft de implementatie ervan op SageMaker HyperPod of Amazon EKS met behulp van p6-b300-instanties met NVIDIA B300 Blackwell Ultra GPU's, vLLM-serving en MXFP4-kwantificatie.
Op 27 juli 2026 bracht Moonshot AI Kimi K3 uit, een mixture of experts (MoE)-model met open gewichten en 2,8 biljoen parameters. Het maakt gebruik van architectuurinnovaties zoals Kimi Delta Attention en Gated Multi Head Latent Attention, waarbij 16 van de 896 experts per token worden geactiveerd (104B actieve parameters). Het model ondersteunt een contextvenster van 1 miljoen tokens, native multimodale invoer (tekst + visie), tool calling en gestructureerde uitvoer. AWS biedt twee implementatieopties: Amazon SageMaker HyperPod met Inference Operator, die de orkestratie abstraheert, en een zelfbeheerd Amazon EKS-cluster met EC2 Capacity Blocks. Beide vereisen p6-b300.48xlarge-instanties (8 NVIDIA B300 Blackwell Ultra GPU's). De gewichten zijn beschikbaar in MXFP4-formaat op Hugging Face, en vLLM is de aanbevolen serving engine. De endpoint exposeert een OpenAI-compatibele API.
Bron: AWS ML blog —
origineel
