Hardware & InferenzModelle 🇷🇺 31.07.2026 16:01

Hybride Transformer unter Last: Wo Gated DeltaNet gegen volle Aufmerksamkeit verliert

Ein Ingenieur testete zwei Qwen-Modelle, eines mit voller Aufmerksamkeit und eines mit einer hybriden Architektur unter Verwendung von Gated DeltaNet, unter agentischer Last auf einer RTX 3090. Das hybride Modell gewinnt bei langen Kontexten und hoher Parallelität, verliert jedoch bei kurzen Dialogen mit gemeinsamen System-Prompts. Das Hauptproblem ist die Sprung der Cache-Blockgröße auf 528 Token, was die Trefferquote des Präfix-Caches verringert und eine Neuberechnung eines Drittels des Prompts erzwingt.
Das Hybridmodell Qwen3.5-4B verwendet in nur 8 von 32 Schichten vollständige Aufmerksamkeit, wobei 24 rekurrente Gated-DeltaNet-Schichten einen Zustand mit fester Größe anstelle eines wachsenden KV-Caches beibehalten. Unter synthetischer agentischer Last auf einer einzelnen RTX 3090 mit vLLM 0.26.0 zeigte das Hybridmodell 84 % Prefix-Cache-Treffer im Vergleich zu 94 % beim voll aufmerksamen Qwen3-4B und berechnete dreimal mehr Prompt-Token neu. Die Ursache liegt darin, dass sich rekurrente Zustandsseiten und KV-Seiten für Aufmerksamkeit einen gemeinsamen Pool teilen, was die Seitengröße für Aufmerksamkeit an die Zustandsseitengröße anpasst und die Blockgröße von 16 auf 528 Token erhöht. Dies verringert die Granularität des Präfix-Abgleichs und erhöht die Neuberechnung. Das Hybridmodell hat zwar eine 3,2-mal größere effektive Cache-Kapazität (297.720 Token gegenüber 93.408), kostet jedoch 2,6 GiB weniger Speicher für den Cache und hat 2,3-mal größere Aktivierungen. Der größere Block erhöht auch den Speicherbedarf pro Token für Zustandsmomentaufnahmen, wenn vollständige Momentaufnahmen aktiviert sind.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten