Donanım ve ÇıkarımModeller 🇷🇺 31.07.2026 16:01

Yük Altında Hibrit Transformers: Kapılı DeltaNet Tam Dikkate Nerede Kaybediyor

Bir mühendis, RTX 3090 üzerinde ajan yükü altında, biri tam dikkatli, diğeri Kapılı DeltaNet kullanan hibrit mimariye sahip iki Qwen modelini test etti. Hibrit model, uzun bağlam ve yüksek eşzamanlılıkta kazanıyor ancak paylaşılan sistem komutları içeren kısa diyaloglarda kaybediyor. Ana sorun, önbellek blok boyutunun 528 tokena atlaması, önek önbelleği isabet oranlarını düşürmesi ve istemin üçte birinin yeniden hesaplanmasını zorunlu kılması.
Hibrit model Qwen3.5-4B, 32 katmanın yalnızca 8'inde tam dikkat kullanır; 24 yinelenen Gated DeltaNet katmanı ise büyüyen KV önbelleği yerine sabit boyutlu bir durum tutar. Tek bir RTX 3090 üzerinde vLLM 0.26.0 ile sentetik aracı yükü altında, hibrit model %84 önek önbellek isabeti gösterirken, tam dikkatli Qwen3-4B %94 isabet gösterdi ve üç kat daha fazla istem belirteci yeniden hesapladı. Temel neden, yinelenen durum sayfaları ve dikkat KV sayfalarının ortak bir havuzu paylaşması ve dikkat sayfa boyutunu durum sayfa boyutuyla eşleşmeye zorlayarak blok boyutunu 16 belirteçten 528 belirtece çıkarmasıdır. Bu, önek eşleştirmenin ayrıntı düzeyini azaltır ve yeniden hesaplamayı artırır. Hibrit modelin etkin önbellek kapasitesi 3,2 kat daha büyüktür (297.720 belirteç ile 93.408 arasında) ancak önbellek için 2,6 GiB daha az bellek ve 2,3 kat daha büyük aktivasyonlar pahasına. Daha büyük blok, tam anlık görüntüleme etkinleştirildiğinde durum anlık görüntüleri için belirteç başına bellek maliyetini de artırır.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler