Nghiên cứuMô hình 🇺🇸 27.07.2026 17:04

Vượt ra ngoài các LLM tiêu chuẩn: Kết hợp chú ý tuyến tính, Khuếch tán văn bản, Mô hình thế giới mã và Transformer đệ quy nhỏ

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face
Bài viết của Sebastian Raschka khám phá các giải pháp thay thế cho các LLM transformer tự hồi quy tiêu chuẩn, bao gồm các kết hợp chú ý tuyến tính (ví dụ: MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), mô hình khuếch tán văn bản, mô hình thế giới mã và các transformer đệ quy nhỏ. Bài viết thảo luận về sự hồi sinh của cơ chế chú ý tuyến tính và những thách thức, chẳng hạn như MiniMax quay lại sử dụng chú ý tiêu chuẩn trong mô hình M2 do hiệu suất kém trên các tác vụ suy luận.
Sebastian Raschka thảo luận về các giải pháp thay thế cho các bộ mã hóa-giải mã tự hồi quy kiểu transformer tiêu chuẩn, vốn được xây dựng dựa trên cơ chế chú ý đa đầu. Các mô hình đáng chú ý bao gồm MiniMax-M1 với chú ý lightning, Qwen3-Next với Gated DeltaNet và Gated Attention, DeepSeek V3.2 với chú ý thưa, và Kimi Linear. Tuy nhiên, MiniMax đã quay lại sử dụng chú ý thông thường trong mô hình M2 của mình, với lý do độ chính xác kém trong các tác vụ suy luận và đa lượt. Qwen3-Next và Kimi Linear sử dụng tỷ lệ 3:1 giữa chú ý tuyến tính (Gated DeltaNet) và chú ý đầy đủ (Gated Attention). Gated DeltaNet kết hợp Mamba2 với quy tắc delta để cập nhật trạng thái hồi quy. Bài báo cũng đề cập đến các giải pháp thay thế khác như mô hình khuếch tán văn bản, mô hình thế giới mã và bộ mã hóa-giải mã hồi quy nhỏ, nhưng không đi vào chi tiết.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới