Hardware e InferênciaModelos 🇷🇺 31.07.2026 16:01

Transformadores Híbridos Sob Carga: Onde o Gated DeltaNet Perde para a Atenção Completa

Um engenheiro testou dois modelos Qwen, um com atenção completa e outro com uma arquitetura híbrida usando Gated DeltaNet, sob carga agêntica em uma RTX 3090. O modelo híbrido vence em contexto longo e alta concorrência, mas perde em diálogos curtos com prompts de sistema compartilhados. O principal problema é o tamanho do bloco de cache saltando para 528 tokens, reduzindo as taxas de acerto do cache de prefixo e forçando a recomputação de um terço do prompt.
O modelo híbrido Qwen3.5-4B usa atenção completa em apenas 8 de 32 camadas, com 24 camadas recorrentes Gated DeltaNet que mantêm um estado de tamanho fixo em vez de um cache KV crescente. Sob carga agêntica sintética em uma única RTX 3090 com vLLM 0.26.0, o híbrido mostrou 84% de hits de cache de prefixo contra 94% do Qwen3-4B com atenção completa, e recomputou três vezes mais tokens de prompt. A causa raiz é que as páginas de estado recorrente e as páginas KV de atenção compartilham um pool comum, forçando o tamanho da página de atenção a corresponder ao tamanho da página de estado, elevando o tamanho do bloco de 16 para 528 tokens. Isso reduz a granularidade da correspondência de prefixo e aumenta a recomputação. O híbrido tem de fato 3,2x maior capacidade efetiva de cache (297.720 tokens contra 93.408), mas ao custo de 2,6 GiB a menos de memória para o cache e ativações 2,3x maiores. O bloco maior também aumenta o custo de memória por token para snapshots de estado quando o snapshot completo está habilitado.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas