ModèlesMatériel et Inférence 🇺🇸 30.07.2026 21:02

Déploiement de Kimi K3 sur AWS

Moonshot AIMoonshot AI NVIDIANVIDIA
Moonshot AI a publié Kimi K3, un modèle MoE (Mixture of Experts) de 2,8 billions de paramètres, en open-weight. L'article de blog AWS décrit son déploiement sur SageMaker HyperPod ou Amazon EKS à l'aide d'instances p6-b300 avec GPU NVIDIA B300 Blackwell Ultra, du service vLLM et de la quantification MXFP4.
Le 27 juillet 2026, Moonshot AI a publié Kimi K3, un modèle de mélange d'experts (MoE) de 2,8 billions de paramètres avec des poids ouverts. Il utilise des innovations architecturales telles que l'attention delta Kimi et l'attention latente multi-têtes à portes, activant 16 des 896 experts par jeton (104 milliards de paramètres actifs). Le modèle prend en charge une fenêtre de contexte d'un million de jetons, une entrée multimodale native (texte et vision), l'appel d'outils et une sortie structurée. AWS propose deux options de déploiement : Amazon SageMaker HyperPod avec Inference Operator, qui abstrait l'orchestration, et un cluster Amazon EKS autogéré utilisant des blocs de capacité EC2. Les deux nécessitent des instances p6-b300.48xlarge (8 GPU NVIDIA B300 Blackwell Ultra). Les poids sont disponibles au format MXFP4 sur Hugging Face, et vLLM est le moteur de service recommandé. Le point de terminaison expose une API compatible OpenAI.
Source: AWS ML blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches