ModellenOnderzoek 🇺🇸 27.07.2026 18:04

Vergelijking van Architectuur van Grote Taalmodellen: Van DeepSeek V3 tot OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka vergelijkt de architecturen van moderne LLM's, waaronder DeepSeek V3 met Multi-Head Latent Attention en Mixture-of-Experts, en OLMo 2 van het Allen Institute for AI met Post-Norm en QK-norm. Het artikel behandelt belangrijke architecturale keuzes zoals Grouped-Query Attention en diverse normalisatieschema's.
In zijn artikel onderzoekt Sebastian Raschka de architectonische kenmerken van moderne grote taalmodellen, waarbij hij DeepSeek V3/R1, OLMo 2 en andere vergelijkt. DeepSeek V3 gebruikt Multi-Head Latent Attention (MLA), die keys en values comprimeert naar een laagdimensionale ruimte om KV-cachegeheugen te besparen, en Mixture-of-Experts (MoE) met 256 experts, waarvan er slechts 9 actief zijn (één gedeelde expert en 8 geselecteerd door de router), waardoor het slechts 37 miljard parameters per stap gebruikt, ondanks dat het in totaal 671 miljard heeft. OLMo 2 van het Allen Institute for AI daarentegen maakt gebruik van traditionele Multi-Head Attention, maar met Post-Norm (RMSNorm na attention- en feedforward-netwerklagen) en QK-norm om training te stabiliseren. Het artikel noemt ook Grouped-Query Attention als alternatief voor Multi-Head Attention dat in andere modellen wordt gebruikt.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws