Infinigence

Laatste AI-nieuws, modellen en releases van Infinigence. ['DeepSeek-V4-pro']

Modellen 🇨🇳

PDD-architectuur doorbreekt cross-cluster heterogene inferentiebarrière: 51,5% lagere first-token latentie, 37,5% kostenreductie

InfiniteG (Infinigence) onthulde PDD, een drie-laags cross-cluster heterogene inferentiearchitectuur die de first-token latentie met 51,5% en de per-token kosten met 37,5% verlaagt. Door een lokale RelayDecode (RLD)-instantie in te voegen om WAN KV Cache-overdrachtvertragingen te maskeren, maakt PDD efficiënt gebruik van verspreide homogene clusters voor LLM-inferentie.

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Vers nieuws