Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2
Sebastian Raschka veröffentlichte einen detaillierten Vergleich der Architekturen moderner offener großer Sprachmodelle und hob dabei wichtige Innovationen hervor: Multi-Head Latent Attention (MLA) und Mixture-of-Experts (MoE) in DeepSeek V3 sowie Normalisierungsmerkmale in OLMo 2. Der Artikel behandelt die Entwicklung von GPT-2 bis zu Modellen aus dem Jahr 2025.
DeepSeek
Allen Institute for AI











