Qwen3-4B с полным вниманием, и пересчитала в три раза больше токенов промпта. Основная причина в том, что страницы рекуррентного состояния и KV-страницы внимания используют общий пул, что вынуждает устанавливать размер страницы внимания равным размеру страницы состояния, увеличивая размер блока с 16 до 528 токенов. Это снижает гранулярность сопоставления префиксов и увеличивает объем пересчетов. При этом гибридная модель имеет в 3,2 раза большую эффективную емкость кэша (297 720 токенов против 93 408), но ценой уменьшения памяти для кэша на 2,6 ГиБ и увеличения активаций в 2,3 раза. Увеличенный блок также повышает затраты памяти на токен для снимков состояния при включенном полном создании снимков.