Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает полному вниманию
Инженер протестировал две модели Qwen — одну с полным вниманием и одну с гибридной архитектурой на основе Gated DeltaNet — в условиях агентной нагрузки на RTX 3090. Гибридная модель выигрывает на длинном контексте и высокой конкурентности, но проигрывает на коротких диалогах с общими системными промптами. Основная проблема — размер блока кэша прыгает до 528 токенов, что снижает частоту попаданий в кэш префикса и вынуждает пересчитывать треть промпта.
Гибридная модель Qwen3.5-4B использует полное внимание только в 8 из 32 слоев, а в остальных 24 слоях применяются рекуррентные слои Gated DeltaNet, которые поддерживают состояние фиксированного размера вместо растущего KV-кэша. При синтетической агентной нагрузке на одной видеокарте RTX 3090 с использованием vLLM 0.26.0 гибридная модель показала 84% попаданий в префиксный кэш против 94% у модели
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
