Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2
Sebastian Raschka vergleicht die Architekturen moderner großer Sprachmodelle, darunter DeepSeek V3 mit Multi-Head Latent Attention und Mixture-of-Experts, sowie OLMo 2 des Allen Institute for Artificial Intelligence mit Post-Norm und QK-norm. Der Artikel behandelt zentrale architektonische Entscheidungen wie Grouped-Query Attention und verschiedene Normalisierungsschemata.
DeepSeek
Allen Institute for AI
Sebastian Raschka27.07 · 18:04






