Infinigence

Últimas notícias, modelos e lançamentos de IA de Infinigence. ['DeepSeek-V4-pro']

Modelos 🇨🇳

Arquitetura PDD Rompe Barreira de Inferência Heterogênea Entre Clusters: 51,5% Menor Latência do Primeiro Token, Redução de 37,5% nos Custos

A InfiniteG (Infinigence) apresentou a PDD, uma arquitetura de inferência heterogênea entre clusters em três camadas que reduz a latência do primeiro token em 51,5% e o custo por token em 37,5%. Ao inserir uma instância local RelayDecode (RLD) para mascarar os atrasos na transferência do cache KV via WAN, a PDD permite a utilização eficiente de clusters homogêneos dispersos para inferência de LLMs.

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Notícias frescas