⚡ 突发新闻
英伟达 Groq 3:新 AI 平台中的 SRAM、解聚和确定性
NVIDIA
Groq
在斥资 200 亿美元收购 Groq 后,英伟达将 LPU 加速器集成到 Vera Rubin 平台中,构建了用于推理的异构架构。全新的 Groq 3 LPX 机架加速器基于 Groq 3 LP30 芯片,配备 500 MB SRAM 和 150 TB/s 内存带宽,确保确定性执行和低延迟。基于阶段的解码解聚(AFD)可将 FFN 计算与注意力机制分离,在 GPU 和 LPU 之间分配工作负载。
英伟达完成了其历史上最大的一笔交易,以200亿美元收购了Groq,并将架构上与自身截然不同的AI加速器LPU集成到其Vera Rubin平台中,从而大幅加速推理,使其实现解耦,并让平台变得异构。新款机架式加速器NVIDIA Groq 3 LPX功耗达160千瓦,包含256个Groq 3 (LP30) AI芯片,每个芯片拥有960亿个晶体管,这些芯片被组合成32个1U高度的节点,采用液冷和无缆化MGX设计。Groq 3 LPU芯片基于500 MB的SRAM内存构建,带宽为150 TB/s,无缓存和层级结构,允许在编译器控制下显式移动数据。LPU的决定性特征是确定性——通过将所有决策转移到编译器并采用准同步芯片间协议,消除了运行时的不确定性。关键创新在于相位解耦解码,它将GPU上执行的注意力机制与LPX上处理的FFN/MoE操作分离开来。这使得GPU能够吸收不断增长的上下文,而LPU上的负载则保持恒定,不受上下文长度影响。为了实际应用异构解码,NVIDIA Dynamo负责请求编排、工作分配,并在高流量下维持稳定的延迟。结合Vera Rubin NVL72和Groq 3 LPX,在每用户400 TPS(每秒事务处理数)下,吞吐量比Grace Blackwell NVL72高出35倍,而对于延迟敏感的工作负载,每兆瓦收入最高可增加10倍。
来源: ServerNews —
原文
