PDD-arkkitehtuuri murtaa klusterien välisen heterogeenisen päättelyn esteen: ensimmäisen tokenin viive 51,5 % pienempi, kustannukset 37,5 % alemmat
Infinigence
InfiniteG (Infinigence) esitteli PDD:n, kolmikerroksisen klusterien välisen heterogeenisen päättelyarkkitehtuurin, joka vähentää ensimmäisen tokenin viivettä 51,5 prosenttia ja tokenikohtaisia kustannuksia 37,5 prosenttia. Lisäämällä paikallisen RelayDecode (RLD) -instanssin piilottamaan WAN KV-välimuistin siirtoviiveet, PDD mahdollistaa hajallaan olevien homogeenisten klusterien tehokkaan käytön suurten kielimallien päättelyssä.
WAIC 2026 -tapahtumassa InfiniteG esitteli PDD:n (Prefill-RelayDecode-MainDecode), uudenlaisen päättelyarkkitehtuurin, joka jakaa perinteisen PD-erottelun kolmeen vaiheeseen. Keskeinen oivallus on, että agenttityökuormissa välimuistin osumat ovat erittäin epätasaisesti jakautuneita (70–80 prosenttia pyynnöistä yli 95 prosentin osumatarkkuudella), minkä vuoksi vain harvat matalan osumatarkkuuden pyynnöt kärsivät pitkistä KV-välimuistin siirtoviiveistä WAN-Ethernetin yli. PDD lisää samoihin tiloihin Prefillin kanssa RelayDecode-instanssin, joka vastaanottaa KV-välimuistin nopean RDMA:n kautta ja aloittaa päättelyn välittömästi, peittäen hitaan Ethernet-siirron etäiseen MainDecode-instanssiin. Kun MD saa täyden KV-välimuistin, kättelymekanismi siirtää vain pieniä token-tunnuksia (muutama kilotavu) MD:lle paikallista uudelleenlaskentaa varten, välttäen suurten KV-tietojen siirrot. Testeissä DeepSeek-V4-pro:n kanssa oikeilla agenttijäljillä PDD vähensi P90 TTFT:tä 18,3 sekunnista 9,8 sekuntiin (46 prosenttia pienempi) ja P99:tä 29,7 sekunnista 14,4 sekuntiin, kun RLD käsitteli vain 6,2 prosenttia tokenien tuotannosta. Kokonaisinfrastruktuurin kustannukset laskivat 3,5–7,1 prosenttia samalla kun efektiivinen suorituskyky (RPS-hyväksyntä) kasvoi 27,8 prosenttia, mikä paransi hyöty-kustannussuhdetta 37,5 prosentilla. Työ mahdollistaa heterogeenisen päättelyn edullisesti WAN-linkitettyjen homogeenisten klustereiden välillä maksimoiden hajallaan olevien laskentaresurssien käytön.
Lähde: QbitAI 量子位 —
Alkuperäinen
