Visuaalinen opas huomion variantteihin moderneissa suurissa kielimalleissa
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Tämä artikkeli tarjoaa visuaalisen yleiskatsauksen huomio mekanismeista moderneissa suurissa kielimalleissa kattaen standardista monipäisestä huomiosta (MHA) ryhmäkyselyhuomioon (GQA), monipäiseen latenttihuomioon (MLA), harvaan huomioon ja hybridiarkkitehtuureihin. Siihen liittyy LLM-arkkitehtuurigalleria, jossa on 45 kohdetta ja julisteversioita.
Sebastian Raschka julkaisi visuaalisen oppaan huomiointimekanismien varianteista nykyaikaisissa suurissa kielimalleissa (LLM) sekä gallerian 45 LLM-arkkitehtuurista. Artikkeli käsittelee monipäähuomiointia (multi-head attention, MHA), sen historiallista kontekstia sekä ryhmiteltyä kyselyhuomiointia (grouped-query attention, GQA), joka vähentää KV-välimuistin kustannuksia jakamalla avain- ja arvopäitä. GQA on suosittu kompromissi tehokkuuden ja laadun välillä. Monipäinen latentti huomiointi (multi-head latent attention, MLA), jota käytetään DeepSeek V3 -mallissa, pakkaa välimuistia aggressiivisemmin säilyttäen samalla paremman suorituskyvyn. Artikkeli käsittelee myös harvaa huomiointia (sparse attention) ja hybridiarkkitehtuureja, ja siinä on esimerkkimalleja jokaiselle variantille. Julisteversio on saatavilla Redbubblesta.
Lähde: Sebastian Raschka —
Alkuperäinen
