ModellenOnderzoek 🇨🇳 30.07.2026 13:02

Van GPT-2 tot Kimi K3: Schaal groeit 22.580x in zeven jaar, belangrijkste architectuurdraad bouwt een "geheugenbesturingssysteem"

Moonshot AIMoonshot AI
De technische evolutie van grote modellen van GPT-2 tot Kimi K3 laat zien hoe AI-architectuur verschuift van "alles onthouden" naar "selectief geheugen". KV Cache lost generatie-efficiëntie op, Linear Attention onderzoekt efficiënter langetermijngeheugen, DeltaNet en Kimi Linear stellen modellen in staat om te leren updaten, vergeten en informatie beheren. Kimi K3 heeft 2,8 biljoen parameters, wat overeenkomt met ongeveer 22.580 GPT-2-modellen.
Het artikel volgt zeven jaar architectuurevolutie, analyseert de technische veranderingen achter de schaalgroei van grote modellen en hoe Kimi K3 doorbreekt met nieuwe geheugenmechanismen die verder gaan dan traditionele Transformers. GPT-2 gebruikte een decoder-only architectuur met token- en positie-embeddings. KV Cache slaat sleutel-waardeparen op om herberekening te voorkomen. Lineaire Attention past featuremaps (bijvoorbeeld ELU+1) toe op q en k, en comprimeert KV-vectoren tot een state-matrix met vaste grootte. DeltaNet breidt Lineaire Attention uit met een deltaregel om het geheugen selectief bij te werken, waardoor informatie-interferentie wordt verminderd. Gated DeltaNet combineert Mamba's gating met de deltaregel en voegt een vervalparameter α toe. Kimi Linear verbetert Gated DeltaNet met fijnmazige kanaalsgewijze gating. Kimi K3's taalkern heeft 23 macrolussen, elk met drie Kimi Delta Attention-lagen en één Multi-Head Latent Attention-laag. Het gebruikt een dicht FFN in de eerste laag en Latent MoE in alle andere lagen. Kimi K3 heeft in totaal 898 experts; twee gedeelde experts verwerken elk token, en de router selecteert 16 experts per token uit de overige 896.
Bron: InfoQ 中国 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws