Vergelijking van Architecturen van Grote Taalmodellen: Van DeepSeek V3 tot OLMo 2
Sebastian Raschka publiceerde een gedetailleerde vergelijking van de architecturen van moderne open LLM's, waarbij hij belangrijke innovaties belicht: Multi-Head Latent Attention (MLA) en Mixture-of-Experts (MoE) in DeepSeek V3, evenals normalisatiefuncties in OLMo 2. Het artikel behandelt de evolutie van GPT-2 tot modellen uit 2025.
DeepSeek
Allen Institute for AI











