Forschung RSS

Modelle 🇺🇸

Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2

Sebastian Raschka vergleicht die Architekturen moderner großer Sprachmodelle, darunter DeepSeek V3 mit Multi-Head Latent Attention und Mixture-of-Experts, sowie OLMo 2 des Allen Institute for Artificial Intelligence mit Post-Norm und QK-norm. Der Artikel behandelt zentrale architektonische Entscheidungen wie Grouped-Query Attention und verschiedene Normalisierungsschemata.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Modelle 🇺🇸

Von GPT-2 zu gpt-oss: Analyse architektonischer Fortschritte und Vergleich mit Qwen3

OpenAI veröffentlichte gpt-oss-120b und gpt-oss-20b, ihre ersten Modelle mit offenen Gewichten seit GPT-2. Die Architektur zeichnet sich durch Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU und MXFP4-Optimierung für lokale Inferenz aus. Vergleiche mit GPT-2 und Qwen3 heben Fortschritte bei Abwägungen zwischen Breite und Tiefe sowie Aufmerksamkeitssenken hervor.

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
Sebastian Raschka27.07 · 18:03
Aktuelle Nachrichten