PDD Mimarisi, Kümeler Arası Heterojen Çıkarım Engelini Aşıyor: İlk Token Gecikmesinde %51,5 Azalma, %37,5 Maliyet Düşüşü
Infinigence
InfiniteG (Infinigence), ilk token gecikmesini %51,5 ve token başına maliyeti %37,5 azaltan üç katmanlı kümeler arası heterojen çıkarım mimarisi PDD'yi tanıttı. WAN KV Cache aktarım gecikmelerini gizlemek için yerel bir RLD (RelayDecode) örneği ekleyen PDD, LLM çıkarımı için dağınık homojen kümelerin verimli bir şekilde kullanılmasını sağlıyor.
WAIC 2026'da InfiniteG, geleneksel PD ayrışımını üç aşamaya ayıran yeni bir çıkarım mimarisi olan PDD'yi (Prefill-RelayDecode-MainDecode) sundu. Temel içgörü, ajan iş yüklerinin yüksek oranda çarpık önbellek isabet oranlarına sahip olmasıdır (isteklerin %70-80'i >%95 isabet oranı), bu da yalnızca birkaç düşük isabetli isteğin WAN Ethernet üzerinden uzun KV Önbellek aktarım gecikmelerine maruz kalmasına neden olur. PDD, Prefill ile aynı kümede bir RelayDecode (RLD) örneği ekler; bu örnek, hızlı RDMA üzerinden KV Önbelleği alır ve hemen kod çözmeye başlayarak uzak MainDecode (MD) örneğine yavaş Ethernet aktarımını maskelemektedir. MD tam KV Önbelleği aldıktan sonra, bir devir teslim mekanizması yalnızca küçük token kimliklerini (birkaç KB) MD'ye aktararak büyük KV aktarımlarından kaçınır. Gerçek ajan izleriyle DeepSeek-V4-pro üzerinde yapılan testlerde PDD, P90 TTFT'yi 18,3 saniyeden 9,8 saniyeye (%46 daha düşük), P99'u ise 29,7 saniyeden 14,4 saniyeye düşürürken RLD yalnızca token oluşturmanın %6,2'sini işledi. Toplam altyapı maliyeti %3,5-7,1 oranında düşerken etkin verim (RPS iyi verim) %27,8 arttı ve fayda-maliyet oranında %37,5 iyileşme sağlandı. Çalışma, düşük maliyetli WAN bağlantılı homojen kümeler arasında heterojen çıkarımı mümkün kılarak dağınık hesaplama kaynaklarının kullanımını en üst düzeye çıkarmaktadır.
Kaynak: QbitAI 量子位 —
orijinal
