ModelPerangkat Keras & Inferensi 🇨🇳 30.07.2026 11:02

Arsitektur PDD Menerobos Hambatan Inferensi Heterogen Lintas Klaster: 51,5% Latensi Token Pertama Lebih Rendah, 37,5% Pengurangan Biaya

InfinigenceInfinigence
InfiniteG (Infinigence) memperkenalkan PDD, arsitektur inferensi heterogen lintas klaster tiga lapis yang mengurangi latensi token pertama sebesar 51,5% dan biaya per token sebesar 37,5%. Dengan menyisipkan instance RelayDecode (RLD) lokal untuk menutupi penundaan transfer KV Cache WAN, PDD memungkinkan pemanfaatan klaster homogen yang tersebar secara efisien untuk inferensi Large Language Model.
Pada WAIC 2026, InfiniteG mempresentasikan PDD (Prefill-RelayDecode-MainDecode), sebuah arsitektur inferensi baru yang mendekomposisi pemisahan PD tradisional menjadi tiga tahap. Inti dari pendekatan ini adalah bahwa beban kerja agen memiliki tingkat hit cache yang sangat miring (70-80% permintaan memiliki tingkat hit >95%), sehingga hanya sedikit permintaan dengan hit rendah yang mengalami penundaan transfer KV Cache yang lama melalui Ethernet WAN. PDD menyisipkan instance RelayDecode (RLD) di klaster yang sama dengan Prefill, yang menerima KV Cache melalui RDMA cepat dan mulai melakukan decoding segera, menutupi penundaan transfer Ethernet yang lambat ke instance MainDecode (MD) jarak jauh. Setelah MD menerima KV Cache lengkap, mekanisme handoff hanya mentransfer token ID kecil (beberapa KB) ke MD untuk rekalkulasi lokal, sehingga menghindari transfer KV yang besar. Dalam pengujian pada DeepSeek-V4-pro dengan jejak agen nyata, PDD berhasil mengurangi P90 TTFT dari 18,3 detik menjadi 9,8 detik (turun 46%), P99 dari 29,7 detik menjadi 14,4 detik, sementara RLD hanya menangani 6,2% dari pembuatan token. Total biaya infrastruktur turun 3,5-7,1%, sementara throughput efektif (goodput RPS) meningkat 27,8%, menghasilkan peningkatan rasio manfaat-biaya sebesar 37,5%. Karya ini memungkinkan inferensi heterogen di seluruh klaster homogen yang terhubung melalui WAN berbiaya rendah, memaksimalkan pemanfaatan sumber daya komputasi yang tersebar.
Sumber: QbitAI 量子位 — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru