Mô hìnhNghiên cứu 🇺🇸 27.07.2026 18:04

So sánh kiến trúc mô hình ngôn ngữ lớn: Từ DeepSeek V3 đến OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka so sánh kiến trúc của các mô hình ngôn ngữ lớn hiện đại, bao gồm DeepSeek V3 với Multi-Head Latent Attention và Mixture-of-Experts, và OLMo 2 từ Viện AI Allen với Post-Norm và QK-norm. Bài viết đề cập đến các quyết định kiến trúc quan trọng như Grouped-Query Attention và các sơ đồ chuẩn hóa khác nhau.
Trong bài viết của mình, Sebastian Raschka xem xét các đặc điểm kiến trúc của các mô hình ngôn ngữ lớn hiện đại, so sánh DeepSeek V3/R1, OLMo 2 và các mô hình khác. DeepSeek V3 sử dụng Multi-Head Latent Attention (MLA) để nén các khóa và giá trị vào không gian chiều thấp nhằm tiết kiệm bộ nhớ đệm KV, cùng với Mixture-of-Experts (MoE) gồm 256 chuyên gia, trong đó chỉ có 9 chuyên gia hoạt động (một chuyên gia dùng chung và 8 chuyên gia được bộ định tuyến chọn), cho phép mô hình chỉ sử dụng 37 tỷ tham số mỗi bước dù có tổng cộng 671 tỷ tham số. OLMo 2 từ Viện AI Allen sử dụng Multi-Head Attention truyền thống nhưng với Post-Norm (RMSNorm sau các lớp attention và feed-forward network) và QK-norm để ổn định quá trình huấn luyện. Bài viết cũng đề cập đến Grouped-Query Attention như một giải pháp thay thế cho Multi-Head Attention được sử dụng trong các mô hình khác.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới