AWS पर Kimi K3 तैनात करना
Moonshot AI
NVIDIA
Moonshot AI ने Kimi K3 जारी किया है, जो 2.8 ट्रिलियन पैरामीटर वाला MoE मॉडल है, जो ओपन-वेट है। AWS ब्लॉग पोस्ट में SageMaker HyperPod या Amazon EKS पर p6-b300 इंस्टेंसेस के साथ NVIDIA B300 Blackwell Ultra GPUs, vLLM सर्विंग, और MXFP4 क्वांटाइजेशन का उपयोग करके इसे तैनात करने का वर्णन किया गया है।
27 जुलाई, 2026 को, Moonshot AI ने Kimi K3 जारी किया, जो 2.8 ट्रिलियन पैरामीटर वाला Mixture of Experts (MoE) मॉडल है और इसके वज़न खुले हैं। इसमें Kimi Delta Attention और Gated Multi Head Latent Attention जैसी आर्किटेक्चर नवाचारों का उपयोग किया गया है, जो प्रति टोकन 896 विशेषज्ञों में से 16 को सक्रिय करता है (104 बिलियन सक्रिय पैरामीटर)। मॉडल 1 मिलियन टोकन का संदर्भ विंडो, मूल मल्टीमॉडल इनपुट (टेक्स्ट+विज़न), टूल कॉलिंग और संरचित आउटपुट का समर्थन करता है। AWS दो डिप्लॉयमेंट विकल्प प्रदान करता है: Amazon SageMaker HyperPod जिसमें Inference Operator है, जो ऑर्केस्ट्रेशन को एब्सट्रैक्ट करता है, और EC2 Capacity Blocks का उपयोग करके स्व-प्रबंधित Amazon EKS क्लस्टर। दोनों के लिए p6-b300.48xlarge इंस्टेंस (8 NVIDIA B300 Blackwell Ultra GPU) की आवश्यकता है। वज़न Hugging Face पर MXFP4 फॉर्मेट में उपलब्ध हैं, और vLLM अनुशंसित सर्विंग इंजन है। एंडपॉइंट OpenAI-संगत API को एक्सपोज़ करता है।
स्रोत: AWS ML blog —
मूल
