PDD आर्किटेक्चर ने क्रॉस-क्लस्टर हेटरोजीनियस इन्फ्रेंस बैरियर को तोड़ा: पहले टोकन की लेटेंसी में 51.5% की कमी, लागत में 37.5% की कमी
Infinigence
InfiniteG (इन्फिनिजेंस) ने PDD नामक तीन-परत क्रॉस-क्लस्टर हेटरोजीनियस इन्फ्रेंस आर्किटेक्चर का अनावरण किया, जो पहले टोकन की लेटेंसी को 51.5% और प्रति-टोकन लागत को 37.5% कम करता है। स्थानीय RelayDecode (RLD) उदाहरण डालकर WAN KV कैश ट्रांसफर विलंब को छिपाते हुए, PDD बड़े भाषा मॉडल इन्फ्रेंस के लिए फैले हुए समरूप क्लस्टरों का कुशल उपयोग सक्षम बनाता है।
WAIC 2026 में InfiniteG ने PDD (प्रीफिल-रिलेडिकोड-मेनडिकोड) प्रस्तुत किया, जो एक नवीन अनुमान वास्तुकला (इन्फ्रेंस आर्किटेक्चर) है, जो पारंपरिक PD पृथक्करण को तीन चरणों में विघटित करती है। मुख्य अंतर्दृष्टि यह है कि एजेंट वर्कलोड में कैश हिट दर अत्यधिक विषम होती है (70-80% अनुरोधों की हिट दर 95% से अधिक होती है), जिसके कारण केवल कुछ कम-हिट अनुरोधों को WAN ईथरनेट पर लंबे KV कैश स्थानांतरण में देरी का सामना करना पड़ता है। PDD प्रीफिल के समान क्लस्टर में एक रिलेडिकोड (RLD) इंस्टेंस सम्मिलित करता है, जो तेज़ RDMA के माध्यम से KV कैश प्राप्त करता है और तुरंत डिकोड करना शुरू कर देता है, जिससे दूरस्थ मेनडिकोड (MD) इंस्टेंस को धीमा ईथरनेट स्थानांतरण छिप जाता है। एक बार MD को पूर्ण KV कैश प्राप्त हो जाने पर, एक हैंडऑफ तंत्र केवल छोटे टोकन आईडी (कुछ KB) को MD में स्थानीय पुनर्गणना के लिए स्थानांतरित करता है, जिससे बड़े KV स्थानांतरण से बचा जा सके। वास्तविक एजेंट ट्रेस के साथ DeepSeek-V4-pro पर परीक्षणों में, PDD ने P90 TTFT को 18.3 सेकंड से घटाकर 9.8 सेकंड (46% कम) कर दिया, P99 को 29.7 सेकंड से 14.4 सेकंड कर दिया, जबकि RLD ने केवल 6.2% टोकन उत्पादन संभाला। कुल बुनियादी ढाँचा लागत में 3.5-7.1% की कमी आई, जबकि प्रभावी थ्रूपुट (RPS गुडपुट) में 27.8% की वृद्धि हुई, जिससे लाभ-लागत अनुपात में 37.5% का सुधार हुआ। यह कार्य कम लागत वाले WAN-लिंक किए गए समरूप क्लस्टरों में विषम अनुमान को सक्षम बनाता है, जो बिखरे हुए कंप्यूट संसाधनों के अधिकतम उपयोग को बढ़ावा देता है।
स्रोत: QbitAI 量子位 —
मूल
