Transformers hybrides sous charge : où Gated DeltaNet perd face à l'attention complète
Un ingénieur a testé deux modèles Qwen, l'un avec attention complète et l'autre avec une architecture hybride utilisant Gated DeltaNet, sous charge agentique sur une RTX 3090. Le modèle hybride gagne sur les contextes longs et la haute concurrence, mais perd sur les dialogues courts avec des prompts système partagés. Le problème principal est que la taille du bloc de cache saute à 528 jetons, réduisant les taux de succès du cache de préfixe et forçant le recalcul d'un tiers du prompt.
Le modèle hybride Qwen3.5-4B utilise l'attention complète dans seulement 8 des 32 couches, avec 24 couches récurrentes Gated DeltaNet qui maintiennent un état de taille fixe au lieu d'un cache KV croissant. Sous charge agentique synthétique sur une seule RTX 3090 avec vLLM 0.26.0, l'hybride a montré un taux de succès du cache de préfixe de 84 % contre 94 % pour l'attention complète de Qwen3-4B, et a recalculé trois fois plus de jetons de prompt. La cause profonde est que les pages d'état récurrentes et les pages KV d'attention partagent un pool commun, ce qui oblige la taille de page d'attention à correspondre à la taille de page d'état, augmentant la taille de bloc de 16 à 528 jetons. Cela réduit la granularité de correspondance des préfixes et augmente le recalcul. L'hybride a effectivement une capacité de cache effective 3,2 fois plus grande (297 720 jetons contre 93 408), mais au prix de 2,6 Gio de mémoire en moins pour le cache et d'activations 2,3 fois plus importantes. Le bloc plus grand augmente également le coût mémoire par jeton pour les instantanés d'état lorsque l'instantané complet est activé.
Source: Habr — хаб ИИ —
original
