L'architecture PDD brise la barrière de l'inférence hétérogène inter-clusters : latence du premier token réduite de 51,5 %, coût réduit de 37,5 %
Infinigence
InfiniteG (Infinigence) a dévoilé PDD, une architecture d'inférence hétérogène inter-clusters à trois couches qui réduit la latence du premier token de 51,5 % et le coût par token de 37,5 %. En insérant une instance locale RelayDecode (RLD) pour masquer les délais de transfert du cache KV sur le réseau étendu (WAN), PDD permet une utilisation efficace de clusters homogènes dispersés pour l'inférence de grands modèles de langage (LLM).
Lors de la WAIC 2026, InfiniteG a présenté PDD (Prefill-RelayDecode-MainDecode), une architecture d'inférence innovante qui décompose la séparation traditionnelle PD en trois étapes. L'idée clé est que les charges de travail des agents présentent des taux de cache hit très asymétriques (70-80 % des requêtes ont un taux de hit supérieur à 95 %), ce qui fait que seules quelques requêtes à faible hit subissent de longs délais de transfert de cache KV via Ethernet WAN. PDD insère une instance RelayDecode (RLD) dans le même cluster que Prefill, qui reçoit le cache KV via un RDMA rapide et commence le décodage immédiatement, masquant le lent transfert Ethernet vers l'instance MainDecode (MD) distante. Une fois que le MD reçoit l'intégralité du cache KV, un mécanisme de handoff ne transfère que de petits identifiants de tokens (quelques KB) vers MD pour un recalcul local, évitant ainsi les grands transferts de KV. Lors des tests sur DeepSeek-V4-pro avec des traces d'agents réelles, PDD a réduit le P90 du TTFT de 18,3 s à 9,8 s (soit une baisse de 46 %), et le P99 de 29,7 s à 14,4 s, tandis que RLD n'a géré que 6,2 % de la génération de tokens. Le coût total de l'infrastructure a baissé de 3,5 à 7,1 % tandis que le débit effectif (goodput en requêtes par seconde) a augmenté de 27,8 %, ce qui a permis d'améliorer le ratio coût-bénéfice de 37,5 %. Ce travail permet une inférence hétérogène entre des clusters homogènes reliés par un WAN à faible coût, maximisant ainsi l'utilisation des ressources de calcul dispersées.
Source: QbitAI 量子位 —
original
