PDD-Architektur durchbricht Barrieren bei heterogenem Cross-Cluster-Inferencing: 51,5% niedrigere Latenz beim ersten Token, 37,5% Kostensenkung
InfiniteG (Infinigence) hat PDD vorgestellt, eine dreischichtige heterogene Cross-Cluster-Inferenzarchitektur, die die Latenz beim ersten Token um 51,5% und die Kosten pro Token um 37,5% senkt. Durch die Einfügung einer lokalen RelayDecode-Instanz (RLD) zur Überbrückung von Verzögerungen beim WAN-KV-Cache-Transfer ermöglicht PDD die effiziente Nutzung verteilter homogener Cluster für LLM-Inferenz.
Infinigence
QbitAI 量子位30.07 · 11:02
