Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2
DeepSeek
Allen Institute for AI
Sebastian Raschka vergleicht die Architekturen moderner großer Sprachmodelle, darunter DeepSeek V3 mit Multi-Head Latent Attention und Mixture-of-Experts, sowie OLMo 2 des Allen Institute for Artificial Intelligence mit Post-Norm und QK-norm. Der Artikel behandelt zentrale architektonische Entscheidungen wie Grouped-Query Attention und verschiedene Normalisierungsschemata.
In seinem Artikel untersucht Sebastian Raschka die architektonischen Merkmale moderner großer Sprachmodelle und vergleicht DeepSeek V3/R1, OLMo 2 und andere. DeepSeek V3 verwendet Multi-Head Latent Attention (MLA), die Schlüssel- und Wertevektoren in einen niedrigdimensionalen Raum komprimiert, um den KV-Cache-Speicher zu sparen, sowie Mixture-of-Experts (MoE) mit 256 Experten, von denen nur 9 aktiv sind (ein gemeinsamer Experte und 8 vom Router ausgewählte). Dadurch werden trotz 671 Milliarden Parametern insgesamt nur 37 Milliarden Parameter pro Schritt genutzt. OLMo 2 vom Allen Institute for AI hingegen setzt auf traditionelle Multi-Head Attention, jedoch mit Post-Norm (RMSNorm nach den Attention- und Feed-Forward-Netzwerk-Schichten) und QK-Norm, um das Training zu stabilisieren. Der Artikel erwähnt auch Grouped-Query Attention als Alternative zur Multi-Head Attention, die in anderen Modellen verwendet wird.
Quelle: Sebastian Raschka —
Original
