ModelleForschung 🇨🇳 30.07.2026 13:02

Von GPT-2 bis Kimi K3: Maßstab wächst 22.580-fach in sieben Jahren, Hauptarchitektur-Thread baut ein „Memory-Betriebssystem“

Moonshot AIMoonshot AI
Die technische Evolution großer Modelle von GPT-2 bis Kimi K3 zeigt, wie sich die KI-Architektur vom „Sich-an-alles-Erinnern“ zum „Selektiven Gedächtnis“ bewegt. KV Cache löst das Problem der Generierungseffizienz, Lineare Aufmerksamkeit erforscht effizienteres Langzeitgedächtnis, DeltaNet und Kimi Linear ermöglichen Modellen, Informationen zu lernen, zu aktualisieren, zu vergessen und zu verwalten. Kimi K3 hat 2,8 Billionen Parameter, das entspricht etwa 22.580 GPT-2-Modellen.
Der Artikel zeichnet die Architekturentwicklung über sieben Jahre nach, analysiert die technischen Veränderungen hinter dem Größenwachstum großer Modelle und wie Kimi K3 mit neuen Speichermechanismen die Grenzen traditioneller Transformatoren durchbricht. GPT-2 verwendete eine Decoder-only-Architektur mit Token- und Positionsembeddings. KV Cache speichert Schlüssel-Wert-Vektoren, um eine Neuberechnung zu vermeiden. Linear Attention wendet Feature Maps (z. B. ELU+1) auf q und k an und komprimiert KV-Vektoren in eine fest dimensionierte Zustandsmatrix. DeltaNet erweitert Linear Attention mit einer Delta-Regel, um den Speicher selektiv zu aktualisieren und Informationsinterferenzen zu reduzieren. Gated DeltaNet kombiniert das Gating von Mamba mit der Delta-Regel und fügt einen Zerfallsparameter α hinzu. Kimi Linear verbessert Gated DeltaNet mit feinkörnigem kanalweisem Gating. Das Sprach-Backbone von Kimi K3 verfügt über 23 Makro-Loops, die jeweils drei Kimi-Delta-Attention-Layer und einen Multi-Head-Latent-Attention-Layer enthalten. Es verwendet dichte FFN in der ersten Schicht und Latent MoE in allen anderen. Kimi K3 hat insgesamt 898 Experten; zwei gemeinsame Experten verarbeiten jedes Token, und der Router wählt pro Token 16 Experten aus den verbleibenden 896 aus.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten