Visuaalinen opas huomion variaatioihin moderneissa suurissa kielimalleissa
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Tämä artikkeli tarjoaa visuaalisen yleiskatsauksen huomionekanismeista moderneissa suurissa kielimalleissa. Se kattaa perinteisestä monipäisestä huomiosta (MHA, multi-head attention) ryhmiteltyyn kyselyhuomioon (GQA, grouped-query attention), monipäiseen latenttihuomioon (MLA, multi-head latent attention), hajahuomioon ja hybridiarkkitehtuureihin. Artikkeliin liittyy LLM-arkkitehtuurigalleria, jossa on 45 kohdetta ja versiot julisteina.
Sebastian Raschka julkaisi visuaalisen oppaan huomiointimekanismien varianteista nykyaikaisissa suurissa kielimalleissa (LLM) sekä gallerian 45 LLM-arkkitehtuurista. Artikkeli käsittelee monipäähuomiointia (multi-head attention, MHA), sen historiallista kontekstia sekä ryhmiteltyä kyselyhuomiointia (grouped-query attention, GQA), joka vähentää KV-välimuistin kustannuksia jakamalla avain- ja arvopäitä. GQA on suosittu kompromissi tehokkuuden ja laadun välillä. Monipäinen latentti huomiointi (multi-head latent attention, MLA), jota käytetään DeepSeek V3 -mallissa, pakkaa välimuistia aggressiivisemmin säilyttäen samalla paremman suorituskyvyn. Artikkeli käsittelee myös harvaa huomiointia (sparse attention) ja hybridiarkkitehtuureja, ja siinä on esimerkkimalleja jokaiselle variantille. Julisteversio on saatavilla Redbubblesta.
Lähde: Sebastian Raschka —
Alkuperäinen
