Suurten kielimallien arkkitehtuurien vertailu: DeepSeek V3:sta OLMo 2:een
DeepSeek
Allen Institute for AI
Sebastian Raschka vertailee nykyaikaisten suurten kielimallien arkkitehtuureja, mukaan lukien DeepSeek V3, jossa on Multi-Head Latent Attention ja asiantuntijasekoitus (Mixture-of-Experts), sekä Allen Institute for AI:n OLMo 2, jossa on Post-Norm ja QK-norm. Artikkeli käsittelee keskeisiä arkkitehtuurivalintoja, kuten Grouped-Query Attention ja erilaisia normalisointimenetelmiä.
Artikkelissaan Sebastian Raschka tarkastelee nykyaikaisten suurten kielimallien arkkitehtonisia ominaisuuksia ja vertailee DeepSeek V3/R1-, OLMo 2 -malleja sekä muita. DeepSeek V3 käyttää Multi-Head Latent Attention -menetelmää (MLA), joka pakkaa avaimet ja arvot matalan dimension avaruuteen säästääkseen KV-välimuistia, sekä Mixture-of-Expertsejä (MoE), joissa on 256 asiantuntijaa, joista vain 9 on aktiivisia (yksi jaettu asiantuntija ja kahdeksan reitittimen valitsemaa). Tämä mahdollistaa sen, että malli käyttää vain 37 miljardia parametria askelta kohden, vaikka sillä on yhteensä 671 miljardia parametria. Allen Institute for AI:n OLMo 2 puolestaan hyödyntää perinteistä Multi-Head Attentionia, mutta Post-Norm-menetelmällä (RMSNorm huomion ja eteenpäin kytketyn neuroverkon kerrosten jälkeen) ja QK-normilla koulutuksen vakauttamiseksi. Artikkelissa mainitaan myös Grouped-Query Attention vaihtoehtona muissa malleissa käytetylle Multi-Head Attentionille.
Lähde: Sebastian Raschka —
Alkuperäinen
