⚡ 速報
NVIDIA Groq 3:新AIプラットフォームにおけるSRAM、ディスアグリゲーション、決定論
NVIDIA
Groq
NVIDIAによる200億ドルのGroq買収により、LPUアクセラレータがVera Rubinプラットフォームに統合され、ディスアグリゲートされたヘテロジニアスなAI推論が可能になりました。新しいGroq 3 LPXラックシステムは256個のLPUを組み合わせ、高速で決定論的なトークン生成を実現し、Vera Rubin NVL72が柔軟なトレーニングと推論を担当します。このプラットフォームは低レイテンシのインタラクティブAIとマルチエージェントワークロードを対象とし、Grace Blackwell NVL72比で最大35倍のパフォーマンス向上(1ユーザーあたり400 TPS)を約束します。
NVIDIAは、200億ドルでの買収に続き、GroqのLPU(Language Processing Unit)アーキテクチャを自社のVera Rubin AIプラットフォームに統合しました。その結果、Vera Rubin NVL72が汎用のトレーニングと推論を処理し、Groq 3 LPXラックアクセラレータが低レイテンシのトークン生成向けの専用エンジンを提供するヘテロジニアスシステムが実現しました。LPXには、それぞれ960億個のトランジスタを搭載した256個のGroq 3(LP30)チップが含まれており、これらはRealScale C2Cインターコネクトを介して接続されています。LPUは決定論的実行モデルを中心に設計されており、チップあたり500 MBのSRAM(帯域幅150 TB/秒)を搭載し、キャッシュは持たず、データ移動はコンパイラによって明示的に制御されます。これにより、ジッターが排除され、予測可能なレイテンシが保証されます。これはインタラクティブAIやマルチエージェントシステムにとって極めて重要です。このプラットフォームはフェーズ分離(AFD)を採用し、アテンション操作とFFN操作を分離します。GPUがプリフィルと長文脈アテンションを担当し、LPUがFFN(フィードフォワードネットワーク)/MoE(混合エキスパート)のデコーディングを高速化します。NVIDIAは、Grace Blackwell NVL72と比較して、ユーザーあたり400 TPSで最大35倍の高速化、レイテンシ重視のワークロードではMWあたりの収益が最大10倍になると主張しています。NVIDIA Dynamoソフトウェアは、このヘテロジニアスなデコーディングを調整し、リクエストを分類して中間活性化状態を管理します。
出典: ServerNews —
原文
