ModelosHardware e Inferencia 🇺🇸 01.08.2026 01:03

Despliegue de Kimi K3 en Amazon SageMaker HyperPod y Amazon EKS

Moonshot AIMoonshot AI vLLMvLLM Amazon Web ServicesAmazon Web Services
Moonshot AI lanzó Kimi K3, un modelo abierto con 2,8 billones de parámetros, el primero en su clase de 3 billones. AWS ofrece dos formas de desplegarlo: SageMaker HyperPod y Amazon EKS. El modelo requiere instancias GPU especializadas p6-b300 y utiliza vLLM para la inferencia.
Moonshot AI ha lanzado el modelo Kimi K3 con pesos abiertos, que cuenta con 2,8 billones de parámetros y es el primer sistema abierto que alcanza la clase de 3 billones de parámetros. La arquitectura incluye Kimi Delta Attention, Gated Multi Head Latent Attention y Stable LatentMoE, activando 16 de los 896 expertos por token, lo que proporciona 104 mil millones de parámetros activos. El modelo admite un contexto de 1 millón de tokens y es multimodal (texto e imágenes). Los pesos están disponibles en Hugging Face en formato MXFP4, y se recomienda vLLM para la inferencia. Para el despliegue se requieren instancias p6-b300 con 8 GPU NVIDIA B300 Blackwell Ultra. AWS ofrece dos formas: SageMaker HyperPod con Inference Operator y Amazon EKS autónomo utilizando Capacity Blocks. Ambos métodos proporcionan una API compatible con OpenAI para las llamadas. El artículo contiene pasos detallados para cada opción, incluida la creación del clúster, la reserva de capacidades, la instalación de controladores y el despliegue de vLLM, así como recomendaciones para la limpieza de recursos.
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas