ModelsHardware & Inference 🇺🇸 01.08.2026 01:03

Развертывание Kimi K3 на Amazon SageMaker HyperPod и Amazon EKS

Moonshot AIMoonshot AI vLLMvLLM Amazon Web ServicesAmazon Web Services
Moonshot AI выпустила Kimi K3 — открытую модель с 2,8 трлн параметров, первую в классе 3 трлн. AWS предлагает два способа развертывания: SageMaker HyperPod и Amazon EKS. Модель требует специализированных GPU-инстансов p6-b300 и использует vLLM для инференса.
Moonshot AI выпустила модель Kimi K3 с открытыми весами, которая насчитывает 2,8 триллиона параметров и является первой открытой системой, достигающей класса 3 триллионов параметров. Архитектура включает Kimi Delta Attention, Gated Multi Head Latent Attention и Stable LatentMoE, активируя 16 из 896 экспертов на токен, что дает 104 миллиарда активных параметров. Модель поддерживает контекст в 1 миллион токенов и является мультимодальной (текст и изображения). Веса доступны на Hugging Face в формате MXFP4, для инференса рекомендуется vLLM. Для развертывания требуются инстансы p6-b300 с 8 GPU NVIDIA B300 Blackwell Ultra. AWS предлагает два способа: SageMaker HyperPod с Inference Operator и автономный Amazon EKS с использованием Capacity Blocks. Оба способа обеспечивают OpenAI-совместимый API для вызовов. Статья содержит подробные шаги для каждого варианта, включая создание кластера, резервирование мощностей, установку драйверов и развертывание vLLM, а также рекомендации по очистке ресурсов.
Сокращения
MoE = Mixture of Experts — смесь экспертов
EKS = Elastic Kubernetes Service — эластичный сервис Kubernetes
GPU = Graphics Processing Unit — графический процессор
MXFP4 = Microscaling Floating Point 4-bit — микромасштабируемая плавающая точка 4-бит
S3 = Amazon Simple Storage Service — простой сервис хранения Amazon
EC2 = Elastic Compute Cloud — эластичное облако вычислений
IAM = Identity and Access Management — управление доступом и идентификацией
VPC = Virtual Private Cloud — виртуальное частное облако
FTP = Flexible Training Plan — гибкий план обучения
MLA = Multi Head Latent Attention — многоголовое латентное внимание
KDA = Kimi Delta Attention — дельта-внимание Kimi
Source: AWS ML blog — original
Our earlier posts on this topic ↓
Fresh news