⚡ TIN NÓNG
Mô hìnhNghiên cứu 🇺🇸 27.07.2026 17:03

Từ DeepSeek V3 đến V3.2: Kiến trúc, Sparse Attention và Cập nhật RL

DeepSeekDeepSeek
DeepSeek phát hành V3.2, mô hình hàng đầu mã nguồn mở với hiệu suất tương đương GPT-5 và Gemini 3.0 Pro. Mô hình giới thiệu DeepSeek Sparse Attention (DSA) để tăng hiệu quả, và tiến hóa từ mô hình suy luận chuyên dụng (R1) sang mô hình suy luận lai (V3.1, V3.2). Dòng thời gian bao gồm V3, R1, R1-0528, V3.1, V3.2-Exp và V3.2, với các điểm nổi bật về kiến trúc như Multi-Head Latent Attention (MLA) và huấn luyện RLVR.
DeepSeek V3.2, được phát hành vào dịp cuối tuần nghỉ lễ tại Mỹ, có hiệu suất ngang bằng GPT-5 và Gemini 3.0 Pro nhưng vẫn là mã nguồn mở. Nó dựa trên V3.1, vốn đã thêm khả năng suy luận lai (chế độ hướng dẫn và suy luận) vào nền tảng V3. Tính năng chính mới là DeepSeek Sparse Attention (DSA), một cơ chế chú ý thưa có khả năng học với bộ đánh chỉ số nhanh và bộ chọn token giúp cải thiện hiệu suất, đặc biệt cho các ngữ cảnh dài. DSA thay thế cơ chế chú ý cửa sổ trượt bằng cách động chọn các token trong quá khứ cần chú ý. V3.2-Exp (tháng 9 năm 2025) là bản phát hành thử nghiệm để chuẩn bị hạ tầng cho V3.2. Các mô hình trước đó: V3 (tháng 12 năm 2024) sử dụng MoE và MLA; R1 (tháng 1 năm 2025) bổ sung khả năng suy luận qua học tăng cường từ phản hồi ngôn ngữ có thể kiểm chứng (RLVR) với tối ưu hóa chính sách nhóm (GRPO); R1-0528 là bản nâng cấp nhỏ. Công ty được cho là đã chuyển từ chip NVIDIA sang Huawei và quay lại NVIDIA. Bản phát hành V3.2 nhằm tạo ra một mô hình lai đa năng, trong khi một phiên bản R2 chuyên dụng có thể vẫn đang được phát triển.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới