AMD julkaisee Instella-MoE-16B-A3B: Täysin avoin asiantuntijaseosmalli, jossa on 2,8 miljardia aktiivista parametria ja joka on koulutettu Instinct-näytönohjaimilla
AMD esitteli Instella-MoE-16B-A3B:n, täysin avoimen asiantuntijaseoskielimallin, jossa on yhteensä 16 miljardia parametria ja 2,8 miljardia aktiivista parametria kutakin tokenia kohden. Se on koulutettu alusta alkaen Instinct MI300X- ja MI325X-näytönohjaimilla. Julkaisu sisältää painot, datasekoitukset, koulutuskonfiguraatiot ja päättelykoodin, ja siinä on innovatiivisia ominaisuuksia, kuten Gated Multi-head Latent Attention ja FarSkip-Collective-liitäntä.
AMD julkaisi Instella-MoE-16B-A3B:n, täysin avoimen Mixture-of-Experts-kielimallin, joka on koulutettu alusta alkaen Instinct MI300X- ja MI325X-näytönohjaimilla. Mallissa on yhteensä 16 miljardia parametria, mutta se aktivoi vain 2,8 miljardia tokenia kohden käyttäen kahta jaettua asiantuntijaa ja kuutta reititettyä asiantuntijaa, jotka valitaan 64:stä jokaista MoE-kerrosta kohden. AMD julkaisee painot jokaisesta koulutusvaiheesta sekä dataseokset, koulutuskonfiguraatiot ja päättelykoodin. Kaksi keskeistä rakenteellista valintaa ovat Gated Multi-head Latent Attention, joka lisää kevyen opitun lähtöportin, ja FarSkip-Collective, joka limittää asiantuntijarinnakkaisen viestinnän laskennan kanssa. AMD raportoi 12,7 prosentin esikoulutusnopeutuksen ja jopa 39,2 prosentin vähennyksen ensimmäiseen tokeniin kuluvassa ajassa, kun mallia palvellaan asiantuntijarinnakkaisuudella. Malli esikoulutettiin 7,1 biljoonalla tokenilla avoimista korpuksista, ja keskivaiheen koulutuksessa käytettiin Dolma3 Dolmino 100B -aineistoa. Pitkän kontekstin vaiheessa ikkunaa laajennettiin 4K:sta 64K:hon YaRN-menetelmällä. Jälkikoulutukseen kuuluu SFT, DPO ja RL Miles-kehyksessä. Perusmallin tarkistuspiste saa keskimäärin 76,7 pistettä, mikä on vahvin täysin avoimien mallien joukossa, edellä Moonlight-16B-A3B:stä (76,2) ja muita. Painot ovat ResearchRAIL-lisenssillä, joka sallii vain akateemisen ja tutkimuskäytön, kun taas koulutuskoodikanta on MIT-lisensoitu.
Lähde: MarkTechPost —
Alkuperäinen
