ModellenHardware & Inferentie 🇺🇸 01.08.2026 01:03

Kimi K3 implementeren op Amazon SageMaker HyperPod en Amazon EKS

Moonshot AIMoonshot AI vLLMvLLM Amazon Web ServicesAmazon Web Services
Moonshot AI heeft Kimi K3 uitgebracht, een open model met 2,8 biljoen parameters, het eerste in de klasse van 3 biljoen. AWS biedt twee manieren voor implementatie: SageMaker HyperPod en Amazon EKS. Het model vereist gespecialiseerde GPU-instanties van het type p6-b300 en gebruikt vLLM voor inferentie.
Moonshot AI heeft het model Kimi K3 uitgebracht met open gewichten, dat 2,8 biljoen parameters telt en het eerste open systeem is dat de klasse van 3 biljoen parameters bereikt. De architectuur omvat Kimi Delta Attention, Gated Multi Head Latent Attention en Stable LatentMoE, waarbij 16 van de 896 experts per token worden geactiveerd, wat resulteert in 104 miljard actieve parameters. Het model ondersteunt een context van 1 miljoen tokens en is multimodaal (tekst en afbeeldingen). De gewichten zijn beschikbaar op Hugging Face in MXFP4-formaat; voor inferentie wordt vLLM aanbevolen. Voor implementatie zijn p6-b300-instanties met 8 NVIDIA B300 Blackwell Ultra GPU's vereist. AWS biedt twee manieren: SageMaker HyperPod met Inference Operator en zelfstandig Amazon EKS met Capacity Blocks. Beide manieren bieden een OpenAI-compatibele API voor aanroepen. Het artikel bevat gedetailleerde stappen voor elke optie, waaronder het creëren van een cluster, het reserveren van capaciteit, het installeren van stuurprogramma's en het implementeren van vLLM, evenals aanbevelingen voor het opschonen van resources.
Bron: AWS ML blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws