частотой попаданий страдает от длительных задержек передачи KV-кэша по WAN-сети Ethernet. PDD добавляет экземпляр RelayDecode (RLD) в том же кластере, что и Prefill, который получает KV-кэш по быстрому протоколу RDMA и немедленно начинает декодирование, маскируя медленную передачу по Ethernet к удалённому экземпляру MainDecode (MD). Как только MD получает полный KV-кэш, механизм передачи передаёт только небольшие идентификаторы токенов (несколько килобайт) на MD для локального перевычисления, избегая передачи больших объёмов KV. В тестах на DeepSeek-V4-pro с реальными агентскими трассами PDD сократил P90 TTFT с 18,3 с до 9,8 с (снижение на 46%), P99 — с 29,7 с до 14,4 с, при этом на RLD приходилось лишь 6,2% генерации токенов. Общая стоимость инфраструктуры снизилась на 3,5–7,1%, а эффективная пропускная способность (RPS goodput) выросла на 27,8%, что дало улучшение соотношения выгоды и затрат на 37,5%. Работа позволяет гетерогенный инференс через малозатратные WAN-соединения однородных кластеров, максимизируя использование распределённых вычислительных ресурсов.