模型硬件与推理 🇨🇳 30.07.2026 11:02

PDD架构打破跨集群异构推理壁垒:首Token延迟降低51.5%,成本降低37.5%

InfinigenceInfinigence
InfiniteG(无限光年)推出了PDD,一种三层跨集群异构推理架构,将首Token延迟降低51.5%,每个Token成本降低37.5%。通过插入本地RelayDecode(RLD)实例来掩盖广域网KV缓存传输延迟,PDD实现了对分散同构集群的高效利用,用于大语言模型推理。
在WAIC 2026上,InfiniteG展示了PDD(预填充-中继解码-主解码),这是一种新型推理架构,将传统的PD分离分解为三个阶段。其关键洞察在于,智能体工作负载的缓存命中率高度倾斜(70-80%的请求命中率超过95%),导致只有少数低命中率请求需要在广域以太网上经历较长的KV缓存传输延迟。PDD在与预填充相同的集群中插入一个中继解码实例,该实例通过快速RDMA接收KV缓存并立即开始解码,从而掩盖了到远程主解码实例的慢速以太网传输。一旦主解码实例接收到完整的KV缓存,一个交接机制仅将微小的令牌ID(几KB)传输到主解码实例进行本地重新计算,避免了大型KV传输。在使用真实智能体轨迹对DeepSeek-V4-pro进行的测试中,PDD将P90首Token生成时间从18.3秒降低到9.8秒(降低46%),P99从29.7秒降低到14.4秒,而中继解码仅处理了6.2%的令牌生成。总基础设施成本下降了3.5-7.1%,而有效吞吐量(每秒请求有效处理量)提高了27.8%,使效益成本比提高了37.5%。这项工作使得跨低成本广域连接的同构集群进行异构推理成为可能,从而最大限度地利用了分散的计算资源。
来源: QbitAI 量子位 — 原文
我们之前关于此话题的帖子 ↓
最新新闻