PDD-Architektur durchbricht Barrieren bei heterogenem Cross-Cluster-Inferencing: 51,5% niedrigere Latenz beim ersten Token, 37,5% Kostensenkung
Infinigence
InfiniteG (Infinigence) hat PDD vorgestellt, eine dreischichtige heterogene Cross-Cluster-Inferenzarchitektur, die die Latenz beim ersten Token um 51,5% und die Kosten pro Token um 37,5% senkt. Durch die Einfügung einer lokalen RelayDecode-Instanz (RLD) zur Überbrückung von Verzögerungen beim WAN-KV-Cache-Transfer ermöglicht PDD die effiziente Nutzung verteilter homogener Cluster für LLM-Inferenz.
Auf der WAIC 2026 präsentierte InfiniteG PDD (Prefill-RelayDecode-MainDecode), eine neuartige Inferenzarchitektur, die die traditionelle PD-Trennung in drei Phasen aufgliedert. Die wichtigste Erkenntnis ist, dass Agent-Workloads stark verzerrte Cache-Trefferquoten aufweisen (70–80 % der Anfragen haben eine Trefferquote von über 95 %), sodass nur wenige Anfragen mit niedriger Trefferquote unter langen KV-Cache-Übertragungsverzögerungen über WAN-Ethernet leiden. PDD fügt eine RelayDecode-Instanz (RLD) im selben Cluster wie Prefill ein, die den KV-Cache über schnelles RDMA empfängt und sofort mit der Dekodierung beginnt, wodurch die langsame Ethernet-Übertragung zur entfernten MainDecode-Instanz (MD) maskiert wird. Sobald die MD den vollständigen KV-Cache erhält, überträgt ein Handoff-Mechanismus nur kleine Token-IDs (wenige KB) an die MD zur lokalen Neuberechnung, wodurch große KV-Übertragungen vermieden werden. In Tests mit DeepSeek-V4-pro und realen Agent-Traces erreichte PDD eine Reduzierung der P90-TTFT von 18,3 s auf 9,8 s (46 % niedriger) und der P99 von 29,7 s auf 14,4 s, während die RLD nur 6,2 % der Tokenerzeugung übernahm. Die gesamten Infrastrukturkosten sanken um 3,5–7,1 %, während der effektive Durchsatz (RPS-Goodput) um 27,8 % stieg, was eine Verbesserung des Nutzen-Kosten-Verhältnisses um 37,5 % ergab. Die Arbeit ermöglicht heterogene Inferenz über kostengünstige WAN-verbundene homogene Cluster hinweg und maximiert die Nutzung verstreuter Rechenressourcen.
Quelle: QbitAI 量子位 —
Original
