Infinigence

Neueste KI-Nachrichten, Modelle und Releases von Infinigence. ['DeepSeek-V4-pro']

Modelle 🇨🇳

PDD-Architektur durchbricht Barrieren bei heterogenem Cross-Cluster-Inferencing: 51,5% niedrigere Latenz beim ersten Token, 37,5% Kostensenkung

InfiniteG (Infinigence) hat PDD vorgestellt, eine dreischichtige heterogene Cross-Cluster-Inferenzarchitektur, die die Latenz beim ersten Token um 51,5% und die Kosten pro Token um 37,5% senkt. Durch die Einfügung einer lokalen RelayDecode-Instanz (RLD) zur Überbrückung von Verzögerungen beim WAN-KV-Cache-Transfer ermöglicht PDD die effiziente Nutzung verteilter homogener Cluster für LLM-Inferenz.

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Aktuelle Nachrichten