Despliegue de Kimi K3 en AWS
Moonshot AI
NVIDIA
Moonshot AI lanzó Kimi K3, un modelo MoE de 2,8 billones de parámetros, de pesos abiertos. La publicación del blog de AWS describe su despliegue en SageMaker HyperPod o Amazon EKS utilizando instancias p6-b300 con GPU NVIDIA B300 Blackwell Ultra, servidor vLLM y cuantización MXFP4.
El 27 de julio de 2026, Moonshot AI lanzó Kimi K3, un modelo Mixture of Experts (MoE) de 2,8 billones de parámetros con pesos abiertos. Utiliza innovaciones arquitectónicas como Kimi Delta Attention y Gated Multi Head Latent Attention, activando 16 de 896 expertos por token (104 mil millones de parámetros activos). El modelo admite una ventana de contexto de 1 millón de tokens, entrada multimodal nativa (texto+visión), llamadas a herramientas y salida estructurada. AWS ofrece dos opciones de implementación: Amazon SageMaker HyperPod con Inference Operator, que abstrae la orquestación, y un clúster autogestionado de Amazon EKS utilizando EC2 Capacity Blocks. Ambas requieren instancias p6-b300.48xlarge (8 GPU NVIDIA B300 Blackwell Ultra). Los pesos están disponibles en formato MXFP4 en Hugging Face, y vLLM es el motor de servición recomendado. El endpoint expone una API compatible con OpenAI.
Fuente: AWS ML blog —
original
