Ming-Flash-Omni: Keskeiset teknologiat ja käytännöt yhtenäiselle täysmodaaliselle mallille
QCon Peking 2026 -tapahtumassa Ant Groupin vanhempi algoritmiasiantuntija Guo Qingpei esitteli yksityiskohtaisesti Ming-Flash-Omni-mallin kehityksen, joka on tuhannen miljardin parametrin täysmodaalinen yhtenäinen malli. Esitys käsitteli yhtenäistä arkkitehtuuria monireitittimellä ja AnyExperts-komponentilla, yhteistyöhön perustuvaa koulutusstrategiaa sekä suunnitteluoptimointeja, jotka saavuttavat huipputason tuloksia eri modaliteeteissa.
Ant Groupin Guo Qingpei esitteli QCon Global Software Development Conference 2026 Pekingissä teknisen arkkitehtuurin ja käytännöt Ming-Flash-Omni-mallin takana, joka on täysin multimodaalinen yhtenäinen malli, jossa on satoja miljardeja parametreja. Malli yhdistää äänen, videon, kuvan ja tekstin ymmärtämisen sekä generointitehtävät yhteen kehykseen. Modaalisuuden yhdistämiseksi tiimi suunnitteli multi-reititinmekanismin käsittelemään modaalispesifistä asiantuntijareititystä sekä AnyExpertsin, joka allokoi asiantuntijoita dynaamisesti tokenin tärkeyden perusteella, vähentäen kuvan ja videon tokenien redundanssia. He esittelivät myös yhteistyöhön perustuvan koulutusstrategian data-annossuunnittelulla ja dynaamisella oppimisnopeuden säädöllä, joka perustuu konvergenssin nopeuteen. Tehtävien yhdistämistä varten he rakensivat jäädytetyn multimodaalisen ymmärtämisen selkärangan päälle, lisäten kuvien generointi- ja puhesynteesikyvykkyydet, täydennettynä hienorakeisella visuaalisella tiedolla generatiivisen segmentointikoulutuksen avulla, kaksivirtatietolähestymistavalla identiteetin säilyttämiseksi sekä typografisten piirteiden erillisellä erottamisella vääristyneen tekstin välttämiseksi. Puhegenerointia parannettiin murre-, tunne- ja mukautettavilla äänensävyohjauksilla sekä samanaikaisella puheen, äänen ja musiikin generoinnilla. Malli saavutti huipputulokset eri modaliteeteissa, vastaten tai ylittäen erikoistuneet mallit, ja se on ensimmäinen avoimen lähdekoodin tuhannen miljardin parametrin täysin multimodaalinen yhtenäinen malli. Tekniset optimoinnit sisälsivät täysin multimodaalisen sekvenssipaketointimenetelmän ja joustavat rinnakkaisstrategiat, parantaen koulutustehokkuutta 67 prosentilla. Tiimi tutki myös esitystason yhtenäistämistä avoimen lähdekoodin projektien MingTok ja MingTok-Audio avulla, osoittaen yhtenäisen kehyksen sekä kuvan että äänen ymmärtämiselle ja generoinnille.
Lähde: InfoQ 中国 —
Alkuperäinen
