En Önemli NLP Mülakat Soruları: Büyük Dil Modeli Mimari Yapıları, Çıkarım ve Optimizasyon
Mistral
Google/DeepMind
Bu makale, modern büyük dil modeli (LLM) mimari yapıları ve çıkarım optimizasyonu üzerine teknik mülakatlar için anahtar konuların ve soruların bir kontrol listesini sağlar. Vanilya Transformer'dan (Pre-Norm, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE) mimari farklılıkları kapsar, LLM çıkarımının neden pahalı olduğunu açıklar ve toplu işleme, KV-önbelleği, niceleme ve diğer hızlandırma tekniklerini tanımlar.
Modern üretken LLM'ler çoğunlukla yalnızca kod çözücü (decoder-only) transformatörlerdir; GPT, LLaMA, Mistral, Qwen ve Gemma gibi aileler açıklık, parametre sayısı (yüz milyonlardan yüz milyarlara kadar), mimari detaylar (Yoğun vs. MoE), dikkat türü, normalizasyon, konumsal kodlama, MLP özellikleri, bağlam penceresi uzunluğu (örneğin, 4k, 32k, 128k token), çok modlu destek, eğitim ve lisans açısından farklılık gösterir. Klasik Transformer ile karşılaştırıldığında, modern LLM'ler Post-Norm yerine Pre-Norm kullanır (daha kararlı eğitim), LayerNorm yerine RMSNorm (daha ucuz), SwiGLU kapılı FFN (daha ifade gücü yüksek ancak üçüncü bir doğrusal katman ekler), RoPE konumsal gömmeleri, tam çok başlı dikkat yerine MQA/GQA, koşullu hesaplama için bazen MoE (uzman karışımı), daha uzun bağlam ve çıkarım optimizasyonları kullanır. Çıkarım pahalıdır çünkü otoregresif üretim her token için tüm ağırlıkları okur, KV-önbelleği bağlam ve yığınla birlikte büyür ve iki aşama vardır: ön doldurma (hesaplama sınırlı) ve kod çözme (bellek sınırlı). Gecikme (ilk token süresi, token arası gecikme) ve verim arasındaki denge kritiktir; optimizasyon teknikleri arasında KV-önbelleği, sayfalı dikkat, sürekli yığınlama, spekülatif kod çözme, niceleme ve damıtma yer alır.
Kaynak: Habr — хаб ИИ —
orijinal
