Implantando o Kimi K3 na AWS
Moonshot AI
NVIDIA
A Moonshot AI lançou o Kimi K3, um modelo MoE de 2,8 trilhões de parâmetros, com pesos abertos. O post do blog da AWS descreve a implantação no SageMaker HyperPod ou Amazon EKS usando instâncias p6-b300 com GPUs NVIDIA B300 Blackwell Ultra, servindo com vLLM e quantização MXFP4.
Em 27 de julho de 2026, a Moonshot AI lançou o Kimi K3, um modelo Mixture of Experts (MoE) de 2,8 trilhões de parâmetros com pesos abertos. Ele utiliza inovações de arquitetura como Kimi Delta Attention e Gated Multi Head Latent Attention, ativando 16 dos 896 especialistas por token (104 bilhões de parâmetros ativos). O modelo suporta uma janela de contexto de 1 milhão de tokens, entrada multimodal nativa (texto + visão), chamada de ferramentas e saída estruturada. A AWS oferece duas opções de implantação: Amazon SageMaker HyperPod com Inference Operator, que abstrai a orquestração, e um cluster Amazon EKS autogerenciado usando EC2 Capacity Blocks. Ambas exigem instâncias p6-b300.48xlarge (8 GPUs NVIDIA B300 Blackwell Ultra). Os pesos estão disponíveis no formato MXFP4 no Hugging Face, e o vLLM é o mecanismo de servidor recomendado. O endpoint expõe uma API compatível com a OpenAI.
Fonte: AWS ML blog —
original
