Hardware e InferenciaModelos 🇷🇺 31.07.2026 16:01

Transformadores Híbridos Bajo Carga: Dónde Gated DeltaNet Pierde Frente a la Atención Completa

Un ingeniero probó dos modelos Qwen, uno con atención completa y otro con una arquitectura híbrida que utiliza Gated DeltaNet, bajo carga agéntica en una RTX 3090. El modelo híbrido gana en contexto largo y alta concurrencia, pero pierde en diálogos cortos con prompts de sistema compartidos. El problema principal es que el tamaño del bloque de caché salta a 528 tokens, lo que reduce las tasas de acierto de caché de prefijo y fuerza el recálculo de un tercio del prompt.
El modelo híbrido Qwen3.5-4B utiliza atención completa solo en 8 de las 32 capas, con 24 capas recurrentes Gated DeltaNet que mantienen un estado de tamaño fijo en lugar de una caché KV que crece. Bajo una carga agéntica sintética en una sola RTX 3090 con vLLM 0.26.0, el híbrido mostró un 84% de aciertos de caché de prefijo frente al 94% del Qwen3-4B con atención completa, y recomputó tres veces más tokens de prompt. La causa raíz es que las páginas de estado recurrente y las páginas KV de atención comparten un pool común, lo que obliga a que el tamaño de página de atención coincida con el tamaño de página de estado, elevando el tamaño de bloque de 16 a 528 tokens. Esto reduce la granularidad del emparejamiento de prefijos y aumenta la recomputación. El híbrido sí tiene una capacidad de caché efectiva 3,2 veces mayor (297 720 tokens frente a 93 408), pero a costa de 2,6 GiB menos de memoria para la caché y activaciones 2,3 veces más grandes. El bloque más grande también aumenta el costo de memoria por token para las instantáneas de estado cuando se habilita la instantánea completa.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas