ModèlesMatériel et Inférence 🇺🇸 01.08.2026 01:03

Déploiement de Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS

Moonshot AIMoonshot AI vLLMvLLM Amazon Web ServicesAmazon Web Services
Moonshot AI a publié Kimi K3, un modèle ouvert avec 2,8 billions de paramètres, le premier de la classe des 3 billions. AWS propose deux méthodes de déploiement : SageMaker HyperPod et Amazon EKS. Le modèle nécessite des instances GPU spécialisées p6-b300 et utilise vLLM pour l'inférence.
Moonshot AI a publié le modèle Kimi K3 avec des poids ouverts, qui compte 2,8 billions de paramètres et constitue le premier système ouvert à atteindre la classe des 3 billions de paramètres. L'architecture comprend Kimi Delta Attention, Gated Multi Head Latent Attention et Stable LatentMoE, activant 16 des 896 experts par jeton, ce qui donne 104 milliards de paramètres actifs. Le modèle prend en charge un contexte de 1 million de jetons et est multimodal (texte et images). Les poids sont disponibles sur Hugging Face au format MXFP4, et vLLM est recommandé pour l'inférence. Pour le déploiement, des instances p6-b300 avec 8 GPU NVIDIA B300 Blackwell Ultra sont nécessaires. AWS propose deux méthodes : SageMaker HyperPod avec Inference Operator et Amazon EKS autonome utilisant Capacity Blocks. Les deux méthodes fournissent une API compatible OpenAI pour les appels. L'article contient des étapes détaillées pour chaque option, y compris la création du cluster, la réservation de capacité, l'installation des pilotes et le déploiement de vLLM, ainsi que des recommandations pour le nettoyage des ressources.
Source: AWS ML blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches