GPT-2:sta Kimi K3:een – skaala kasvaa 22 580-kertaiseksi seitsemässä vuodessa, pääarkkitehtuuri rakentaa "muistin käyttöjärjestelmää"
Moonshot AI
Suurten kielimallien tekninen kehitys GPT-2:sta Kimi K3:een osoittaa, miten tekoälyarkkitehtuuri siirtyy "kaiken muistamisesta" "valikoivaan muistiin". KV-välimuisti ratkaisee tuotannon tehokkuuden, lineaariattention mahdollistaa tehokkaamman pitkäaikaismuistin, ja DeltaNet ja Kimi Lineari opettavat mallia päivittämään, unohtamaan ja hallitsemaan tietoa. Kimi K3:ssa on 2,8 biljoonaa parametria, mikä vastaa noin 22 580 GPT-2-mallia.
Artikkelissa seurataan seitsemän vuoden arkkitehtuurikehitystä ja analysoidaan suurten kielimallien skaalautumisen taustalla olevia teknisiä muutoksia sekä sitä, kuinka Kimi K3 ylittää perinteisen Transformer-arkkitehtuurin rajoitukset uusilla muistimekanismeilla. GPT-2 käytti dekoderivain arkkitehtuuria, jossa olivat token- ja paikkaupotukset. KV-välimuisti tallentaa avain-arvo-vektorit uudelleenlaskennan välttämiseksi. Lineaarinen huomio soveltaa ominaisuuskarttoja (esimerkiksi ELU+1) q:hon ja k:hon pakkaamalla KV-vektorit kiinteäkokoiseen tilamatriisiin. DeltaNet laajentaa lineaarista huomiota delta-säännöllä, jonka avulla muistia päivitetään valikoivasti, mikä vähentää informaatiohäiriötä. Gated DeltaNet yhdistää Mamban portituksen delta-sääntöön lisäten vaimennusparametrin α. Kimi Linear parantaa Gated DeltaNetiä hienojakoisella kanavakohtaisella portituksella. Kimi K3:n kielirangassa on 23 makrosilmukkaa, joista jokainen sisältää kolme Kimi Delta -huomiokerrosta ja yhden Multi-Head Latent -huomiokerroksen. Se käyttää tiheää etuperiäissyöttöverkkoa (FFN) ensimmäisessä kerroksessa ja latenttia MoE:tä kaikissa muissa kerroksissa. Kimi K3:ssa on yhteensä 898 asiantuntijaa; kaksi jaettua asiantuntijaa käsittelee jokaisen tokenin, ja reititin valitsee 16 asiantuntijaa tokenia kohden jäljellä olevista 896:sta.
Lähde: InfoQ 中国 —
Alkuperäinen
