Infinigence

Berita AI terbaru, model, dan rilis dari Infinigence. ['DeepSeek-V4-pro']

Model 🇨🇳

Arsitektur PDD Menerobos Hambatan Inferensi Heterogen Lintas Klaster: 51,5% Latensi Token Pertama Lebih Rendah, 37,5% Pengurangan Biaya

InfiniteG (Infinigence) memperkenalkan PDD, arsitektur inferensi heterogen lintas klaster tiga lapis yang mengurangi latensi token pertama sebesar 51,5% dan biaya per token sebesar 37,5%. Dengan menyisipkan instance RelayDecode (RLD) lokal untuk menutupi penundaan transfer KV Cache WAN, PDD memungkinkan pemanfaatan klaster homogen yang tersebar secara efisien untuk inferensi Large Language Model.

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Berita terbaru