Büyük Dil Modeli Mimarilerinin Karşılaştırması: DeepSeek V3'ten OLMo 2'ye
DeepSeek
Allen Institute for AI
Sebastian Raschka, modern büyük dil modellerinin (LLM) mimarilerini karşılaştırıyor: Çok Başlı Gizli Dikkat (Multi-Head Latent Attention) ve Uzman Karışımı (Mixture-of-Experts) kullanan DeepSeek V3 ile Post-Norm ve QK-norm kullanan Allen Yapay Zeka Enstitüsü'nden OLMo 2. Makale, Gruplandırılmış-Sorgu Dikkati (Grouped-Query Attention) ve çeşitli normalizasyon şemaları gibi temel mimari kararları kapsıyor.
Makalesinde Sebastian Raschka, modern büyük dil modellerinin mimari özelliklerini inceleyerek DeepSeek V3/R1, OLMo 2 ve diğerlerini karşılaştırıyor. DeepSeek V3, anahtar ve değerleri düşük boyutlu bir uzaya sıkıştırarak KV önbellek belleğinden tasarruf sağlayan Çok Başlıklı Gizli Dikkat (Multi-Head Latent Attention - MLA) ve toplamda 671 milyar parametreye sahip olmasına rağmen her adımda yalnızca 37 milyar parametre kullanmasını sağlayan, 256 uzmandan oluşan ve bunlardan sadece 9'unun (bir paylaşılan uzman ve yönlendirici tarafından seçilen 8 uzman) aktif olduğu Uzman Karışımı (Mixture-of-Experts - MoE) kullanıyor. Allen Yapay Zeka Enstitüsü'nden (Allen Institute for AI) OLMo 2 ise geleneksel Çok Başlıklı Dikkat (Multi-Head Attention) kullanmakla birlikte, eğitimi dengelemek için Dikkat ve İleri Beslemeli Ağ (feed-forward network) katmanlarından sonra Normalleştirme (Post-Norm) (RMSNorm) ve Sorgu-Anahtar normalleştirmesi (QK-norm) uyguluyor. Makale ayrıca diğer modellerde kullanılan Çok Başlıklı Dikkat'e alternatif olarak Gruplandırılmış Sorgu Dikkati'nden (Grouped-Query Attention) bahsediyor.
Kaynak: Sebastian Raschka —
orijinal
