Arsitektur PDD Menerobos Hambatan Inferensi Heterogen Lintas Klaster: 51,5% Latensi Token Pertama Lebih Rendah, 37,5% Pengurangan Biaya
InfiniteG (Infinigence) memperkenalkan PDD, arsitektur inferensi heterogen lintas klaster tiga lapis yang mengurangi latensi token pertama sebesar 51,5% dan biaya per token sebesar 37,5%. Dengan menyisipkan instance RelayDecode (RLD) lokal untuk menutupi penundaan transfer KV Cache WAN, PDD memungkinkan pemanfaatan klaster homogen yang tersebar secara efisien untuk inferensi Large Language Model.
Infinigence
QbitAI 量子位30.07 · 11:02
