Nghiên cứuMô hình 🇺🇸 28.07.2026 15:05

Hướng dẫn trực quan về các biến thể cơ chế chú ý trong LLM hiện đại

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Bài viết cung cấp tổng quan trực quan về các cơ chế chú ý trong các mô hình ngôn ngữ lớn hiện đại, bao gồm từ cơ chế chú ý đa đầu (multi-head attention, MHA) tiêu chuẩn đến cơ chế chú ý nhóm truy vấn (grouped-query attention, GQA), cơ chế chú ý tiềm ẩn đa đầu (multi-head latent attention, MLA), cơ chế chú ý thưa (sparse attention) và kiến trúc lai. Kèm theo là bộ sưu tập kiến trúc LLM với 45 mục và phiên bản poster.
Sebastian Raschka đã công bố một hướng dẫn trực quan về các biến thể của cơ chế attention trong các mô hình ngôn ngữ lớn (LLM) hiện đại, cùng với một bộ sưu tập 45 kiến trúc LLM. Bài viết đề cập đến multi-head attention (MHA - cơ chế chú ý đa đầu), bối cảnh lịch sử của nó, và grouped-query attention (GQA - cơ chế chú ý truy vấn nhóm) giúp giảm chi phí KV-cache bằng cách chia sẻ các đầu key-value (khóa-giá trị). GQA là một sự đánh đổi phổ biến giữa hiệu quả và chất lượng. Multi-head latent attention (MLA - cơ chế chú ý tiềm ẩn đa đầu), được sử dụng trong DeepSeek V3, nén cache mạnh mẽ hơn trong khi vẫn duy trì hiệu suất tốt hơn. Bài viết cũng thảo luận về sparse attention (cơ chế chú ý thưa) và các kiến trúc lai, đồng thời bao gồm các mô hình ví dụ cho từng biến thể. Một phiên bản áp phích có sẵn qua Redbubble.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới