Perbandingan Arsitektur Model Bahasa Besar: Dari DeepSeek V3 hingga OLMo 2
DeepSeek
Allen Institute for AI
Sebastian Raschka membandingkan arsitektur LLM modern, termasuk DeepSeek V3 dengan Multi-Head Latent Attention dan Mixture-of-Experts, serta OLMo 2 dari Allen Institute for AI dengan Post-Norm dan QK-norm. Artikel ini membahas keputusan arsitektur utama seperti Grouped-Query Attention dan berbagai skema normalisasi.
Dalam artikelnya, Sebastian Raschka mengamati fitur arsitektur model bahasa besar modern, membandingkan DeepSeek V3/R1, OLMo 2, dan lainnya. DeepSeek V3 menggunakan Multi-Head Latent Attention (MLA), yang mengompresi kunci dan nilai ke dalam ruang dimensi rendah untuk menghemat memori cache KV, dan Mixture-of-Experts (MoE) dengan 256 pakar, di mana hanya 9 yang aktif (satu pakar bersama dan 8 dipilih oleh router), sehingga hanya menggunakan 37 miliar parameter per langkah meskipun totalnya 671 miliar. OLMo 2 dari Allen Institute for AI, di sisi lain, menggunakan Multi-Head Attention tradisional tetapi dengan Post-Norm (RMSNorm setelah lapisan attention dan feed-forward network) dan QK-norm untuk menstabilkan pelatihan. Artikel ini juga menyebutkan Grouped-Query Attention sebagai alternatif Multi-Head Attention yang digunakan pada model lain.
Sumber: Sebastian Raschka —
asli
