PDD架构打破跨集群异构推理壁垒:首Token延迟降低51.5%,成本降低37.5%
InfiniteG(无限光年)推出了PDD,一种三层跨集群异构推理架构,将首Token延迟降低51.5%,每个Token成本降低37.5%。通过插入本地RelayDecode(RLD)实例来掩盖广域网KV缓存传输延迟,PDD实现了对分散同构集群的高效利用,用于大语言模型推理。
Infinigence
QbitAI 量子位30.07 · 11:02
InfiniteG(无限光年)推出了PDD,一种三层跨集群异构推理架构,将首Token延迟降低51.5%,每个Token成本降低37.5%。通过插入本地RelayDecode(RLD)实例来掩盖广域网KV缓存传输延迟,PDD实现了对分散同构集群的高效利用,用于大语言模型推理。
Infinigence