Transformer Hibrida di Bawah Beban: Di Mana Gated DeltaNet Kalah dari Attention Penuh
Seorang insinyur menguji dua model Qwen, satu dengan attention penuh dan satu dengan arsitektur hibrida menggunakan Gated DeltaNet, di bawah beban agen di RTX 3090. Model hibrida menang pada konteks panjang dan konkurensi tinggi tetapi kalah pada dialog pendek dengan system prompt bersama. Masalah utamanya adalah ukuran blok cache melonjak ke 528 token, mengurangi rasio cache hit prefiks dan memaksa komputasi ulang sepertiga dari prompt.
Model hibrida Qwen3.5-4B menggunakan perhatian penuh hanya pada 8 dari 32 lapisan, dengan 24 lapisan Gated DeltaNet berulang yang mempertahankan status berukuran tetap alih-alih cache KV yang terus bertambah. Di bawah beban kerja sintetis agen pada satu RTX 3090 dengan vLLM 0.26.0, hibrida ini menunjukkan 84% cache awalan yang cocok dibandingkan 94% untuk Qwen3-4B perhatian penuh, dan menghitung ulang token prompt tiga kali lebih banyak. Akar masalahnya adalah bahwa halaman status berulang dan halaman KV perhatian berbagi kumpulan yang sama, memaksa ukuran halaman perhatian cocok dengan ukuran halaman status, sehingga meningkatkan ukuran blok dari 16 menjadi 528 token. Ini mengurangi granularitas pencocokan awalan dan meningkatkan penghitungan ulang. Hibrida ini memang memiliki kapasitas cache efektif 3,2 kali lebih besar (297.720 token vs 93.408) tetapi dengan biaya memori cache lebih sedikit 2,6 GiB dan aktivasi 2,3 kali lebih besar. Blok yang lebih besar juga meningkatkan biaya memori per token untuk snapshot status saat snapshot penuh diaktifkan.
Sumber: Habr — хаб ИИ —
asli
