Panduan Visual untuk Varian Perhatian pada LLM Modern
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Artikel ini memberikan gambaran visual tentang mekanisme perhatian dalam model bahasa besar modern, mencakup dari perhatian multi-kepala standar (MHA) hingga perhatian kueri-berkelompok (GQA), perhatian laten multi-kepala (MLA), perhatian jarang, dan arsitektur hibrida. Disertai dengan galeri arsitektur LLM dengan 45 entri dan versi poster.
Sebastian Raschka merilis panduan visual tentang varian atensi dalam LLM modern, lengkap dengan galeri 45 arsitektur LLM. Artikel ini membahas multi-head attention (MHA), konteks historisnya, dan grouped-query attention (GQA) yang mengurangi biaya KV-cache dengan berbagi kepala key-value. GQA merupakan pertukaran yang populer antara efisiensi dan kualitas. Multi-head latent attention (MLA), yang digunakan dalam DeepSeek V3, mengompres cache dengan lebih agresif namun tetap mempertahankan performa yang lebih baik. Artikel ini juga membahas sparse attention dan arsitektur hibrida, serta menyertakan contoh model untuk setiap varian. Versi poster tersedia melalui Redbubble.
Sumber: Sebastian Raschka —
asli
