모델하드웨어 및 추론 🇺🇸 30.07.2026 21:02

AWS에서 Kimi K3 배포하기

Moonshot AIMoonshot AI NVIDIANVIDIA
Moonshot AI가 2.8조 파라미터 Mixture-of-Experts 모델인 Kimi K3를 오픈 웨이트로 출시했습니다. AWS 블로그 게시물에서는 NVIDIA B300 Blackwell Ultra GPU를 탑재한 p6-b300 인스턴스를 사용하여 SageMaker HyperPod 또는 Amazon EKS에 배포하고, vLLM 서빙 및 MXFP4 양자화를 적용하는 방법을 설명합니다.
2026년 7월 27일, Moonshot AI가 2조 8000억 개의 파라미터를 가진 Mixture of Experts(MoE) 모델인 Kimi K3를 오픈 웨이트로 출시했습니다. 이 모델은 Kimi Delta Attention과 Gated Multi Head Latent Attention 같은 아키텍처 혁신을 사용하며, 토큰당 896개의 전문가 중 16개를 활성화합니다(유효 파라미터 1040억 개). 이 모델은 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 입력(텍스트+비전), 도구 호출 및 구조화된 출력을 지원합니다. AWS는 두 가지 배포 옵션을 제공합니다: 오케스트레이션을 추상화하는 Amazon SageMaker HyperPod with Inference Operator와 EC2 Capacity Blocks를 사용한 자체 관리형 Amazon EKS 클러스터입니다. 두 옵션 모두 p6-b300.48xlarge 인스턴스(8개의 NVIDIA B300 Blackwell Ultra GPU)가 필요합니다. 웨이트는 Hugging Face에서 MXFP4 형식으로 제공되며, vLLM이 권장 서빙 엔진입니다. 엔드포인트는 OpenAI 호환 API를 노출합니다.
출처: AWS ML blog — 원문
관련 게시물 ↓
새로운 뉴스