L'architecture PDD brise la barrière de l'inférence hétérogène inter-clusters : latence du premier token réduite de 51,5 %, coût réduit de 37,5 %
InfiniteG (Infinigence) a dévoilé PDD, une architecture d'inférence hétérogène inter-clusters à trois couches qui réduit la latence du premier token de 51,5 % et le coût par token de 37,5 %. En insérant une instance locale RelayDecode (RLD) pour masquer les délais de transfert du cache KV sur le réseau étendu (WAN), PDD permet une utilisation efficace de clusters homogènes dispersés pour l'inférence de grands modèles de langage (LLM).
Infinigence
QbitAI 量子位30.07 · 11:02
