Hybridimuuntajat kuormituksessa: missä Gated DeltaNet häviää täydelle huomiolle
Insinööri testasi kahta Qwen-mallia, toista täydellä huomiolla ja toista hybridiarkkitehtuurilla, joka käyttää Gated DeltaNet -mekanismia, agenttikuormituksella RTX 3090 -näytönohjaimella. Hybridimalli voittaa pitkässä kontekstissa ja korkeassa samanaikaisuudessa, mutta häviää lyhyissä keskusteluissa, joissa on jaettu järjestelmäkehote. Pääongelma on välimuistin lohkokoon kasvaminen 528 tokiniin, mikä vähentää etuliitevälimuistin osumisprosenttia ja pakottaa kolmanneksen kehotteen uudelleenlaskennan.
Hybridimalli Qwen3.5-4B käyttää täyttä attentionia vain 8:ssa 32 kerroksesta, ja 24:ssä toistuvassa Gated DeltaNet -kerroksessa on kiinteän kokoinen tila kasvavan KV-välimuistin sijaan. Synteettisessä agenttikuormituksessa yhdellä RTX 3090 -näytönohjaimella ja vLLM 0.26.0 -versiolla hybridimalli saavutti 84 prosentin osumatarkkuuden etuliitevälimuistissa verrattuna täyden attentionin Qwen3-4B-mallin 94 prosenttiin, ja se joutui laskemaan uudelleen kolme kertaa enemmän prompt-tokeneita. Perimmäinen syy on, että toistuvien tilojen sivut ja attentionin KV-sivut jakavat yhteisen varannon, mikä pakottaa attentionin sivukoon vastaamaan tilasivun kokoa ja nostaa lohkokoon 16 tokenista 528 tokeneihin. Tämä vähentää etuliitteiden täsmäytyksen tarkkuutta ja lisää uudelleenlaskentaa. Hybridimallilla on toki 3,2 kertaa suurempi efektiivinen välimuistin kapasiteetti (297 720 tokenia vs. 93 408), mutta se maksaa 2,6 gigatavua vähemmän muistia välimuistille ja 2,3 kertaa suuremmat aktivaatiot. Suurempi lohko lisää myös tokenkohtaista muistinkulutusta tilan tilannevedoksissa, kun koko tilannevedosten ottaminen on käytössä.
Lähde: Habr — хаб ИИ —
Alkuperäinen
