PDD-architectuur doorbreekt cross-cluster heterogene inferentiebarrière: 51,5% lagere first-token latentie, 37,5% kostenreductie
InfiniteG (Infinigence) onthulde PDD, een drie-laags cross-cluster heterogene inferentiearchitectuur die de first-token latentie met 51,5% en de per-token kosten met 37,5% verlaagt. Door een lokale RelayDecode (RLD)-instantie in te voegen om WAN KV Cache-overdrachtvertragingen te maskeren, maakt PDD efficiënt gebruik van verspreide homogene clusters voor LLM-inferentie.
Infinigence
QbitAI 量子位30.07 · 11:02
