Arquitetura PDD Rompe Barreira de Inferência Heterogênea Entre Clusters: 51,5% Menor Latência do Primeiro Token, Redução de 37,5% nos Custos
A InfiniteG (Infinigence) apresentou a PDD, uma arquitetura de inferência heterogênea entre clusters em três camadas que reduz a latência do primeiro token em 51,5% e o custo por token em 37,5%. Ao inserir uma instância local RelayDecode (RLD) para mascarar os atrasos na transferência do cache KV via WAN, a PDD permite a utilização eficiente de clusters homogêneos dispersos para inferência de LLMs.
Infinigence
QbitAI 量子位30.07 · 11:02
