RisetModel 🇺🇸 28.07.2026 15:05

Panduan Visual tentang Varian Attention di LLM Modern

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Artikel ini memberikan gambaran visual tentang mekanisme attention dalam model bahasa besar modern, mencakup dari multi-head attention (MHA) standar hingga grouped-query attention (GQA), multi-head latent attention (MLA), sparse attention, dan arsitektur hybrid. Dilengkapi dengan galeri arsitektur LLM yang berisi 45 entri dan versi poster.
Sebastian Raschka merilis panduan visual tentang varian atensi dalam LLM modern, lengkap dengan galeri 45 arsitektur LLM. Artikel ini membahas multi-head attention (MHA), konteks historisnya, dan grouped-query attention (GQA) yang mengurangi biaya KV-cache dengan berbagi kepala key-value. GQA merupakan pertukaran yang populer antara efisiensi dan kualitas. Multi-head latent attention (MLA), yang digunakan dalam DeepSeek V3, mengompres cache dengan lebih agresif namun tetap mempertahankan performa yang lebih baik. Artikel ini juga membahas sparse attention dan arsitektur hibrida, serta menyertakan contoh model untuk setiap varian. Versi poster tersedia melalui Redbubble.
Sumber: Sebastian Raschka — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru