⚡ 速報
NVIDIA Groq 3: SRAM, Disaggregation, and Determinism in the New AI Platform
NVIDIA
Groq
After acquiring Groq for $20 billion, NVIDIA integrated LPU accelerators into the Vera Rubin platform, creating a heterogeneous architecture for inference. The new Groq 3 LPX rack accelerator, based on Groq 3 LP30 chips with 500 MB of SRAM and 150 TB/s memory bandwidth, ensures deterministic execution and low latency. Phase-based disaggregation of decoding (AFD) allows separating FFN computations from attention, distributing the workload between GPUs and LPUs.
NVIDIAは史上最大の取引を完了し、Groqを200億ドルで買収しました。そして、アーキテクチャ的に異質なAIアクセラレータLPUを自社のVera Rubinプラットフォームに統合し、推論を大幅に高速化して、それを非集約化(デアグリゲーション)し、プラットフォームをヘテロジニアスにしました。新しいラックマウント型アクセラレータNVIDIA Groq 3 LPXは消費電力160kWで、256個のAIチップGroq 3(LP30)を搭載し、各チップは960億トランジスタを内蔵しています。これらは32ノード(高さ1U)にまとめられ、液体冷却とケーブル不要のMGX構造を採用しています。Groq 3 LPUチップは500MBのSRAMメモリ上に構築され、メモリ帯域幅は150TB/sであり、キャッシュや階層構造を持たず、コンパイラの制御下で明示的にデータを移動します。LPUの決定的な特徴は決定性(デターミニズム)であり、実行時のばらつきを排除するために、すべての決定をコンパイラに委ね、プレシオクロナスC2Cプロトコルを使用しています。重要な革新は、位相分離型デコード(AFD:Attention-Focused Decoding)であり、GPUで実行されるアテンション機構と、LPXで処理されるFFN/MoE演算を分離します。これにより、GPUは増大するコンテキスト量を吸収できる一方、LPUへの負荷は一定でコンテキスト長に依存しません。このヘテロジニアスデコードを実用化するために、NVIDIA Dynamoがリクエストのオーケストレーション、負荷分散、高トラフィック下での安定したレイテンシ維持を実現します。Vera Rubin NVL72とGroq 3 LPXの組み合わせは、Grace Blackwell NVL72と比較して、ユーザーあたり400 TPSで35倍のスループット向上を達成し、レイテンシに敏感なワークロードではMWあたり最大10倍の収益向上をもたらします。
出典: ServerNews —
原文
