Hardware & InferentieModellen 🇷🇺 31.07.2026 16:01

Hybride Transformers onder Belasting: Waar Gated DeltaNet Verliest van Volledige Aandacht

Een ingenieur testte twee Qwen-modellen, een met volledige aandacht en een met een hybride architectuur die gebruikmaakt van Gated DeltaNet, onder agentische belasting op een RTX 3090. Het hybride model wint bij lange context en hoge gelijktijdigheid, maar verliest bij korte dialogen met gedeelde systeemprompts. Het grootste probleem is dat de cacheblokgrootte springt naar 528 tokens, waardoor de prefix-cache-hitratio daalt en een derde van de prompt opnieuw moet worden berekend.
Het hybride model Qwen3.5-4B gebruikt volledige aandacht in slechts 8 van de 32 lagen, met 24 recurrente Gated DeltaNet-lagen die een vaste toestandsgrootte behouden in plaats van een groeiende KV-cache. Onder synthetische agentische belasting op een enkele RTX 3090 met vLLM 0.26.0, liet de hybride 84% prefix-cache-hits zien versus 94% voor de volledige aandacht Qwen3-4B, en herberekende het drie keer zoveel prompt-tokens. De oorzaak is dat recurrente toestandspagina's en aandacht-KV-pagina's een gemeenschappelijke pool delen, waardoor de aandachts-paginagrootte gedwongen wordt overeen te komen met de toestandspaginagrootte, wat de blokgrootte verhoogt van 16 naar 528 tokens. Dit vermindert de granulariteit van prefix-matching en verhoogt de herberekening. De hybride heeft wel 3,2x grotere effectieve cachecapaciteit (297.720 tokens versus 93.408), maar ten koste van 2,6 GiB minder geheugen voor de cache en 2,3x grotere activaties. Het grotere blok verhoogt ook de geheugenkosten per token voor toestandsfoto's wanneer volledige snapshotting is ingeschakeld.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws