Biến áp lai khi chịu tải: Nơi Gated DeltaNet thua kém Full Attention
Một kỹ sư đã thử nghiệm hai mẫu Qwen, một mẫu dùng full attention và một mẫu dùng kiến trúc lai với Gated DeltaNet, dưới tải tác nhân trên RTX 3090. Mẫu lai thắng về ngữ cảnh dài và độ đồng thời cao nhưng thua trong các hội thoại ngắn có system prompt dùng chung. Vấn đề chính là kích thước khối bộ nhớ đệm nhảy lên 528 token, giảm tỷ lệ trúng bộ nhớ đệm tiền tố và buộc phải tính toán lại một phần ba prompt.
Mô hình lai Qwen3.5-4B sử dụng cơ chế attention đầy đủ chỉ ở 8 trên 32 lớp, với 24 lớp Gated DeltaNet hồi quy duy trì trạng thái có kích thước cố định thay vì bộ nhớ đệm KV tăng dần. Dưới tải tác tử tổng hợp trên một chiếc RTX 3090 với vLLM 0.26.0, mô hình lai cho thấy tỷ lệ trúng bộ nhớ đệm tiền tố là 84% so với 94% của Qwen3-4B với attention đầy đủ, và phải tính toán lại số lượng token tiền tố gấp ba lần. Nguyên nhân gốc rễ là các trang trạng thái hồi quy và các trang KV attention dùng chung một nhóm tài nguyên, buộc kích thước trang attention phải khớp với kích thước trang trạng thái, làm tăng kích thước khối từ 16 lên 528 token. Điều này làm giảm độ chi tiết của việc khớp tiền tố và tăng khối lượng tính toán lại. Mô hình lai có dung lượng bộ nhớ đệm hiệu quả lớn hơn 3.2 lần (297.720 token so với 93.408 token) nhưng phải đánh đổi bằng việc giảm 2.6 GiB bộ nhớ dành cho bộ nhớ đệm và tăng 2.3 lần kích thước activations. Kích thước khối lớn hơn cũng làm tăng chi phí bộ nhớ cho mỗi token khi lưu trạng thái nếu bật tính năng lưu trạng thái toàn phần.
Nguồn: Habr — хаб ИИ —
bản gốc
