ModelRiset 🇨🇳 30.07.2026 13:02

Dari GPT-2 hingga Kimi K3: Skala Tumbuh 22.580 Kali dalam Tujuh Tahun, Arsitektur Utama Bangun "Sistem Operasi Memori"

Moonshot AIMoonshot AI
Evolusi teknis model besar dari GPT-2 hingga Kimi K3 menunjukkan bagaimana arsitektur AI bergerak dari "mengingat segalanya" menuju "memori selektif". KV Cache menyelesaikan efisiensi generasi, Linear Attention mengeksplorasi memori jangka panjang yang lebih efisien, DeltaNet dan Kimi Linear memungkinkan model belajar memperbarui, melupakan, dan mengelola informasi. Kimi K3 memiliki 2,8 triliun parameter, setara dengan sekitar 22.580 model GPT-2.
Artikel ini melacak evolusi arsitektur selama tujuh tahun, menganalisis perubahan teknis di balik pertumbuhan skala model besar dan bagaimana Kimi K3 menerobos keterbatasan Transformer tradisional dengan mekanisme memori baru. GPT-2 menggunakan arsitektur decoder-only dengan token dan position embedding. KV Cache menyimpan vektor kunci-nilai untuk menghindari perhitungan ulang. Linear Attention menerapkan peta fitur (misalnya, ELU+1) pada q dan k, mengompresi vektor KV menjadi matriks keadaan berukuran tetap. DeltaNet memperluas Linear Attention dengan aturan delta untuk memperbarui memori secara selektif, mengurangi interferensi informasi. Gated DeltaNet menggabungkan gating Mamba dengan aturan delta, menambahkan parameter peluruhan alpha. Kimi Linear meningkatkan Gated DeltaNet dengan gating saluran yang lebih terperinci. Backbone bahasa Kimi K3 memiliki 23 makro-loop, masing-masing berisi tiga lapisan Kimi Delta Attention dan satu lapisan Multi-Head Latent Attention. Lapisan pertama menggunakan FFN padat, sementara sisanya menggunakan Latent Mixture of Experts (MoE). Kimi K3 memiliki total 898 ahli; dua ahli bersama memproses setiap token, dan router memilih 16 ahli per token dari 896 ahli yang tersisa.
Sumber: InfoQ 中国 — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru