Ming-Flash-Omni: Belangrijkste Technologieën en Praktijken van een Uniform Volledig-Modaliteitsmodel
Op QCon Beijing 2026 gaf Guo Qingpei, senior algoritme-expert bij Ant Group, een gedetailleerde uiteenzetting over de ontwikkeling van Ming-Flash-Omni, een uniform model met duizend miljard parameters voor alle modaliteiten. De lezing behandelde de uniforme architectuur met multi-router en AnyExperts, een gezamenlijke trainingsstrategie en technische optimalisaties, waarmee state-of-the-art resultaten werden behaald op het gebied van alle modaliteiten.
Guo Qingpei van Ant Group presenteerde op de QCon Global Software Development Conference 2026 in Beijing de technische architectuur en praktijken achter Ming-Flash-Omni, een volledig modaal uniform model met honderden miljarden parameters. Het model verenigt audio-, video-, beeld- en tekstbegrip met generatietaken in één raamwerk. Om modaliteitsuniformiteit aan te pakken, ontwierp het team een multi-router mechanisme voor modaliteitsspecifieke expertroutering en AnyExperts, dat experts dynamisch toewijst op basis van tokenbelang, waardoor redundantie in beeld- en videotokens wordt verminderd. Ze introduceerden ook een collaboratieve trainingsstrategie met dataverhoudingsplanning en dynamische leersnelheidsaanpassing op basis van convergentiesnelheid. Voor taakuniformiteit bouwden ze voort op een bevroren multimodale begripsbackbone, met toevoeging van beeldgeneratie en spraaksynthesecapaciteiten, aangevuld met fijnkorrelige visuele kennis via generatieve segmentatietraining, een dual-stream informatiebenadering voor identiteitsbehoud, en afzonderlijke extractie van typografische kenmerken om vervormde tekst te voorkomen. Spraakgeneratie werd verbeterd met dialect-, emotie- en aangepaste timbrecontroles, en gelijktijdige generatie van spraak, geluid en muziek. Het model behaalde state-of-the-art resultaten over modaliteiten heen, evenaarde of overtrof gespecialiseerde modellen, en is het eerste open-source model met duizend miljard parameters dat volledig modaal is. Technische optimalisaties omvatten een full-modality sequence packing schema en flexibele parallelle strategieën, die de trainingsefficiëntie met 67% verbeterden. Het team verkende ook representatieniveau-uniformiteit met open-sourceprojecten MingTok en MingTok-Audio, waarmee een uniform raamwerk voor zowel beeld- als audiobegrip en -generatie werd gedemonstreerd.
Bron: InfoQ 中国 —
origineel
