⚡ TIN NÓNG
Nghiên cứuMô hình 🇺🇸 27.07.2026 13:06

Đổi mới kiến trúc LLM: Chia sẻ KV, Embedding theo lớp và Chú ý nén

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Sebastian Raschka xem xét các tiến bộ kiến trúc LLM mã nguồn mở gần đây tập trung vào hiệu quả ngữ cảnh dài. Các kỹ thuật chính bao gồm chia sẻ KV qua các lớp (Gemma 4), embedding theo lớp (Gemma 4 E2B/E4B), phân bổ chú ý theo lớp (Laguna XS.2), chú ý tích chập nén (ZAYA1), và mHC với chú ý nén (DeepSeek V4). Các phương pháp này giảm kích thước bộ đệm KV và lưu lượng bộ nhớ cho các quy trình suy luận và tác nhân.
Sebastian Raschka khảo sát những thay đổi kiến trúc mở gần đây của mô hình ngôn ngữ lớn (LLM) nhằm giảm chi phí xử lý ngữ cảnh dài. Trong Gemma 4 E2B/E4B, các lớp sau tái sử dụng trạng thái key-value từ các lớp trước (cross-layer attention), giúp tiết kiệm khoảng một nửa kích thước bộ nhớ đệm KV (ví dụ: 2,7 GB ở ngữ cảnh 128K). Ngoài ra, các mô hình này sử dụng phần nhúng riêng theo lớp (PLE) để tăng dung lượng mà không mở rộng stack transformer chính—số tham số 'hiệu dụng' nhỏ hơn tổng số bao gồm cả phần nhúng. Laguna XS.2 của Poolside thay đổi chi phí attention theo lớp, với 30 lớp sliding-window (cửa sổ 512) và 10 lớp full-attention. ZAYA1-8B giới thiệu compressed convolutional attention, và DeepSeek V4 sử dụng mHC và compressed attention. Những tinh chỉnh này xuất phát từ nhu cầu ngày càng tăng về xử lý ngữ cảnh dài hiệu quả trong các mô hình suy luận và quy trình tác nhân.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới