Amazon SageMaker HyperPod と Amazon EKS での Kimi K3 のデプロイ
Moonshot AI
vLLM
Amazon Web Services
Moonshot AI は、2.8 兆パラメータを持つオープンモデル Kimi K3 をリリースしました。これは、3 兆クラスとしては初のモデルです。AWS は、SageMaker HyperPod と Amazon EKS という 2 つのデプロイ方法を提供しています。このモデルには、専用の GPU インスタンス p6-b300 が必要であり、推論には vLLM を使用します。
Moonshot AIは、オープンウェイトのモデルKimi K3をリリースしました。このモデルは2.8兆パラメータを備え、3兆パラメータクラスに達する最初のオープンシステムです。アーキテクチャには、Kimi Delta Attention、Gated Multi Head Latent Attention、Stable LatentMoEが含まれており、トークンごとに896エキスパートのうち16をアクティブ化し、1,040億のアクティブパラメータを実現します。このモデルは100万トークンのコンテキストをサポートし、マルチモーダル(テキストと画像)です。ウェイトはHugging FaceでMXFP4形式で入手可能で、推論にはvLLMが推奨されます。デプロイには、8つのNVIDIA B300 Blackwell Ultra GPUを搭載したp6-b300インスタンスが必要です。AWSは2つの方法を提供しています:SageMaker HyperPodとInference Operatorを使用する方法、およびCapacity Blocksを使用したスタンドアロンのAmazon EKSを使用する方法です。どちらの方法でも、呼び出しにOpenAI互換のAPIが提供されます。この記事には、各オプションの詳細な手順が含まれており、クラスターの作成、キャパシティの予約、ドライバーのインストール、vLLMのデプロイ、およびリソースのクリーンアップに関する推奨事項が含まれています。
出典: AWS ML blog —
原文
