Panduan Visual tentang Varian Attention di LLM Modern
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Artikel ini memberikan gambaran visual tentang mekanisme attention dalam model bahasa besar modern, mencakup dari multi-head attention (MHA) standar hingga grouped-query attention (GQA), multi-head latent attention (MLA), sparse attention, dan arsitektur hybrid. Dilengkapi dengan galeri arsitektur LLM yang berisi 45 entri dan versi poster.
Sebastian Raschka merilis panduan visual tentang varian atensi dalam LLM modern, lengkap dengan galeri 45 arsitektur LLM. Artikel ini membahas multi-head attention (MHA), konteks historisnya, dan grouped-query attention (GQA) yang mengurangi biaya KV-cache dengan berbagi kepala key-value. GQA merupakan pertukaran yang populer antara efisiensi dan kualitas. Multi-head latent attention (MLA), yang digunakan dalam DeepSeek V3, mengompres cache dengan lebih agresif namun tetap mempertahankan performa yang lebih baik. Artikel ini juga membahas sparse attention dan arsitektur hibrida, serta menyertakan contoh model untuk setiap varian. Versi poster tersedia melalui Redbubble.
Sumber: Sebastian Raschka —
asli
