⚡ 突发新闻
NVIDIA Groq 3:新AI平台中的SRAM、解耦与确定性计算
NVIDIA
Groq
NVIDIA以200亿美元收购Groq后,将LPU加速器集成到Vera Rubin平台中,实现了解耦的异构AI推理。新的Groq 3 LPX机架系统结合了256个LPU,用于快速、确定性的令牌生成,而Vera Rubin NVL72则处理灵活的训练和推理。该平台针对低延迟交互式AI和多智能体工作负载,承诺在每用户400 TPS下性能比Grace Blackwell NVL72快达35倍。
英伟达在完成200亿美元收购后,将Groq的LPU(语言处理单元)架构集成到其Vera Rubin AI平台中。结果形成了一个异构系统:Vera Rubin NVL72处理通用训练和推理任务,而Groq 3 LPX机架加速器则提供专用引擎,用于低延迟令牌生成。LPX包含256颗Groq 3(LP30)芯片,每颗芯片拥有960亿个晶体管,通过RealScale C2C互连连接。LPU采用确定性执行模型设计,每颗芯片配备500 MB SRAM(带宽150 TB/s),无缓存,且数据移动由编译器显式控制。这消除了抖动,确保了可预测的延迟,对交互式AI和多智能体系统至关重要。该平台采用阶段分解(AFD),将注意力与前馈网络操作分离:GPU处理预填充和长上下文注意力,而LPU加速前馈网络/混合专家模型解码。英伟达声称,相比Grace Blackwell NVL72,该平台在每用户400 TPS下的速度提升可达35倍,在延迟敏感的负载下,每兆瓦营收提升可达10倍。英伟达Dynamo软件负责协调异构解码,对请求进行分类并管理中间激活。
来源: ServerNews —
原文
