ModelosHardware e Inferência 🇨🇳 30.07.2026 11:02

Arquitetura PDD Rompe Barreira de Inferência Heterogênea Entre Clusters: 51,5% Menor Latência do Primeiro Token, Redução de 37,5% nos Custos

InfinigenceInfinigence
A InfiniteG (Infinigence) apresentou a PDD, uma arquitetura de inferência heterogênea entre clusters em três camadas que reduz a latência do primeiro token em 51,5% e o custo por token em 37,5%. Ao inserir uma instância local RelayDecode (RLD) para mascarar os atrasos na transferência do cache KV via WAN, a PDD permite a utilização eficiente de clusters homogêneos dispersos para inferência de LLMs.
Na WAIC 2026, a InfiniteG apresentou o PDD (Prefill-RelayDecode-MainDecode), uma nova arquitetura de inferência que decompõe a separação tradicional PD em três estágios. A principal percepção é que as cargas de trabalho de agentes têm taxas de acerto de cache altamente assimétricas (70-80% das solicitações têm taxa de acerto superior a 95%), fazendo com que apenas algumas solicitações com baixo acerto sofram longos atrasos de transferência de KV Cache sobre Ethernet WAN. O PDD insere uma instância RelayDecode (RLD) no mesmo cluster que o Prefill, que recebe o KV Cache via RDMA rápida e começa a decodificar imediatamente, mascarando a transferência lenta via Ethernet para a instância remota MainDecode (MD). Uma vez que a MD recebe o KV Cache completo, um mecanismo de handoff transfere apenas pequenos IDs de token (poucos KB) para a MD para recomputação local, evitando grandes transferências de KV. Em testes no DeepSeek-V4-pro com traces reais de agentes, o PDD alcançou redução de P90 na TTFT de 18,3s para 9,8s (46% menor), P99 de 29,7s para 14,4s, enquanto a RLD lidou com apenas 6,2% da geração de tokens. O custo total da infraestrutura caiu 3,5-7,1% enquanto a taxa de transferência efetiva (goodput de RPS) aumentou 27,8%, resultando em uma melhoria de 37,5% na relação custo-benefício. O trabalho possibilita inferência heterogênea entre clusters homogêneos interligados por WAN de baixo custo, maximizando a utilização de recursos computacionais dispersos.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas