TutkimusMallit 🇨🇳 28.07.2026 16:03

Globaalin erän kuormantasapainotus: lähes ilmainen lounas MoE-LLM-koulutuksen tehostamiseksi

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ehdottaa globaalin erän kuormantasapainotusmenetelmää sekoitettujen asiantuntijoiden (MoE) malleille, joka ohittaa mikroerätasapainon rajoitukset synkronoimalla asiantuntijavalintataajuudet kaikkien mikroerien välillä. Kokeet osoittavat parantunutta suorituskykyä ja asiantuntijoiden erikoistumista eri mallikooissa ja data-asetelmissa.
Mixture-of-Experts (MoE) -arkkitehtuuri on suosittu tekniikka malliparametrien skaalaamiseen, mutta olemassa olevat koulutuskehykset, kuten Megatron-core, käyttävät mikrosatsitason kuormantasaushäviötä, mikä voi heikentää suorituskykyä, kun mikrosatsit sisältävät homogeenista dataa (esim. vain koodia). Alibaba Qwen esittelee globaalisatsitason tasapainohäviön, joka synkronoi asiantuntijoiden valintatiheyden kaikkien rinnakkaisryhmien välillä ja laskee häviön globaalisti. Kokeet kolmella MoE-konfiguraatiolla (3,4B/0,6B aktivoitu, 15B/2,54B aktivoitu, 43B/6,6B aktivoitu) ja jopa 400 miljardilla tokenilla osoittavat, että globaalisatsitason tasapaino toimii johdonmukaisesti paremmin kuin mikrosatsitason tasapaino eri tehtävissä. Se johtaa myös asiantuntijoiden merkittävään toimialuekohtaiseen erikoistumiseen, mikä puuttuu mikrosatsitason tasapainotetuista malleista. Pienen mikrosatsitason tasapainohäviön (paino 0,01) lisääminen globaalin häviön päälle parantaa koulutusnopeutta vaikuttamatta tehokkuuteen. Menetelmä on lähes ilmainen, koska synkronointi sisältää vain vektorin, jonka koko on yhtä suuri kuin asiantuntijoiden määrä. Työ on julkaistu arXiv-esipainetussa 2501.11873.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset