ModelleHardware & Inferenz 🇺🇸 01.08.2026 01:03

Bereitstellung von Kimi K3 auf Amazon SageMaker HyperPod und Amazon EKS

Moonshot AIMoonshot AI vLLMvLLM Amazon Web ServicesAmazon Web Services
Moonshot AI hat Kimi K3 veröffentlicht – ein offenes Modell mit 2,8 Billionen Parametern, das erste seiner Klasse mit 3 Billionen. AWS bietet zwei Bereitstellungsoptionen: SageMaker HyperPod und Amazon EKS. Das Modell erfordert spezialisierte GPU-Instanzen p6-b300 und nutzt vLLM für die Inferenz.
Moonshot AI hat das Modell Kimi K3 mit offenen Gewichten veröffentlicht. Es umfasst 2,8 Billionen Parameter und ist das erste offene System, das die Klasse von 3 Billionen Parametern erreicht. Die Architektur umfasst Kimi Delta Attention, Gated Multi Head Latent Attention und Stable LatentMoE, wobei pro Token 16 von 896 Experten aktiviert werden, was 104 Milliarden aktiven Parametern entspricht. Das Modell unterstützt einen Kontext von 1 Million Token und ist multimodal (Text und Bilder). Die Gewichte sind auf Hugging Face im Format MXFP4 verfügbar; für die Inferenz wird vLLM empfohlen. Für die Bereitstellung sind Instanzen vom Typ p6-b300 mit 8 GPUs NVIDIA B300 Blackwell Ultra erforderlich. AWS bietet zwei Möglichkeiten: SageMaker HyperPod mit Inference Operator und eigenständiges Amazon EKS unter Verwendung von Capacity Blocks. Beide Ansätze gewährleisten eine OpenAI-kompatible API für Aufrufe. Der Artikel enthält detaillierte Schritte für jede Option, einschließlich der Erstellung des Clusters, der Reservierung von Kapazitäten, der Installation von Treibern und der Bereitstellung von vLLM sowie Empfehlungen zur Bereinigung von Ressourcen.
Quelle: AWS ML blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten