RisetModel 🇺🇸 28.07.2026 15:05

Panduan Visual untuk Varian Perhatian pada LLM Modern

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Artikel ini memberikan gambaran visual tentang mekanisme perhatian dalam model bahasa besar modern, mencakup dari perhatian multi-kepala standar (MHA) hingga perhatian kueri-berkelompok (GQA), perhatian laten multi-kepala (MLA), perhatian jarang, dan arsitektur hibrida. Disertai dengan galeri arsitektur LLM dengan 45 entri dan versi poster.
Sebastian Raschka merilis panduan visual tentang varian atensi dalam LLM modern, lengkap dengan galeri 45 arsitektur LLM. Artikel ini membahas multi-head attention (MHA), konteks historisnya, dan grouped-query attention (GQA) yang mengurangi biaya KV-cache dengan berbagi kepala key-value. GQA merupakan pertukaran yang populer antara efisiensi dan kualitas. Multi-head latent attention (MLA), yang digunakan dalam DeepSeek V3, mengompres cache dengan lebih agresif namun tetap mempertahankan performa yang lebih baik. Artikel ini juga membahas sparse attention dan arsitektur hibrida, serta menyertakan contoh model untuk setiap varian. Versi poster tersedia melalui Redbubble.
Sumber: Sebastian Raschka — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru