Từ GPT-2 đến Kimi K3: Quy mô tăng 22.580 lần trong bảy năm, kiến trúc chính xây dựng "Hệ điều hành bộ nhớ"
Moonshot AI
Sự tiến hóa kỹ thuật của các mô hình lớn từ GPT-2 đến Kimi K3 cho thấy kiến trúc AI chuyển từ "ghi nhớ mọi thứ" sang "bộ nhớ chọn lọc". KV Cache giải quyết hiệu quả sinh, Linear Attention khám phá bộ nhớ dài hạn hiệu quả hơn, DeltaNet và Kimi Linear cho phép mô hình học cách cập nhật, quên và quản lý thông tin. Kimi K3 có 2,8 nghìn tỷ tham số, tương đương khoảng 22.580 mô hình GPT-2.
Bài viết này lược sử bảy năm tiến hóa kiến trúc, phân tích những thay đổi kỹ thuật đằng sau sự tăng trưởng quy mô của các mô hình lớn và cách Kimi K3 vượt qua giới hạn của Transformer truyền thống bằng các cơ chế bộ nhớ mới. GPT-2 sử dụng kiến trúc decoder-only với token embedding và position embedding. KV Cache lưu trữ các vector key-value để tránh tính toán lại. Linear Attention áp dụng các feature map (ví dụ: ELU+1) lên q và k, nén các vector KV thành một ma trận trạng thái có kích thước cố định. DeltaNet mở rộng Linear Attention với quy tắc delta để cập nhật bộ nhớ một cách chọn lọc, giảm nhiễu thông tin. Gated DeltaNet kết hợp cơ chế gating của Mamba với quy tắc delta, thêm tham số suy giảm α. Kimi Linear cải tiến Gated DeltaNet với cơ chế gating theo kênh chi tiết (channel-wise gating). Phần ngôn ngữ chính (language backbone) của Kimi K3 có 23 macro-loop, mỗi macro-loop chứa ba lớp Kimi Delta Attention và một lớp Multi-Head Latent Attention. Nó sử dụng FFN dày đặc (dense FFN) ở lớp đầu tiên và Latent MoE ở tất cả các lớp còn lại. Kimi K3 có tổng cộng 898 chuyên gia; hai chuyên gia dùng chung xử lý mọi token, và bộ định tuyến (router) chọn 16 chuyên gia cho mỗi token từ 896 chuyên gia còn lại.
Nguồn: InfoQ 中国 —
bản gốc
