硬件与推理模型 🇷🇺 31.07.2026 16:01

负载下的混合 Transformer:门控 DeltaNet 在何处不如完整注意力机制

一位工程师在 RTX 3090 上对两个 Qwen 模型进行了测试,一个采用完整注意力机制,另一个采用基于门控 DeltaNet 的混合架构,均处于智能体负载下。混合模型在长上下文和高并发场景中表现更优,但在共享系统提示词的短对话中表现不佳。主要问题在于缓存块大小跃升至 528 个 Token,降低了前缀缓存命中率,导致约三分之一的提示词需重新计算。
混合模型 Qwen3.5-4B 在 32 层中仅 8 层使用全注意力,其余 24 层为循环 Gated DeltaNet 层,保持固定大小的状态而非不断增长的 KV 缓存。在单张 RTX 3090 上使用 vLLM 0.26.0 进行合成智能体负载测试时,混合模型的 prefix 缓存命中率为 84%,而全注意力 Qwen3-4B 为 94%,并且重新计算的 prompt token 数量是三倍。根本原因在于循环状态页和注意力 KV 页共享一个公共池,迫使注意力页大小与状态页大小匹配,导致块大小从 16 个 token 增加到 528 个 token。这降低了前缀匹配的粒度,增加了重新计算量。混合模型的有效缓存容量确实大 3.2 倍(297,720 个 token 对比 93,408 个),但代价是缓存内存减少 2.6 GiB,激活值增大 2.3 倍。更大的块还增加了启用完整快照时状态快照的每 token 内存成本。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻