Ming-Flash-Omni : technologies clés et pratiques d'un modèle unifié toutes modalités
Lors du QCon Beijing 2026, Guo Qingpei, expert senior en algorithmes chez Ant Group, a détaillé le développement de Ming-Flash-Omni, un modèle unifié toutes modalités à mille milliards de paramètres. L'exposé a couvert l'architecture unifiée avec multi-routeur et AnyExperts, une stratégie de formation collaborative et des optimisations d'ingénierie, atteignant des résultats de pointe dans toutes les modalités.
Guo Qingpei, d’Ant Group, a présenté l’architecture technique et les pratiques à l’origine de Ming-Flash-Omni, un modèle unifié multimodal complet comptant des centaines de milliards de paramètres, lors de la conférence QCon Global Software Development Conference 2026 à Pékin. Le modèle unifie la compréhension de l’audio, de la vidéo, de l’image et du texte avec des tâches de génération au sein d’un seul et même cadre.
Pour répondre au défi de l’unification des modalités, l’équipe a conçu un mécanisme multi-routeur destiné à gérer le routage d’experts spécifique à chaque modalité, ainsi qu’AnyExperts, qui alloue dynamiquement les experts en fonction de l’importance des tokens, réduisant ainsi la redondance des tokens issus des images et des vidéos. Elle a également mis en place une stratégie d’entraînement collaboratif reposant sur une planification des ratios de données et un ajustement dynamique du taux d’apprentissage en fonction de la vitesse de convergence.
Pour l’unification des tâches, l’équipe s’est appuyée sur un socle (backbone) de compréhension multimodale gelé, auquel elle a ajouté des capacités de génération d’images et de synthèse vocale, complétées par des connaissances visuelles fines obtenues grâce à un entraînement de segmentation générative, une approche à double flux d’informations pour la préservation de l’identité, ainsi qu’une extraction distincte des caractéristiques typographiques afin d’éviter les textes illisibles. La génération vocale a été enrichie par des contrôles de dialecte, d’émotion et de timbre personnalisé, ainsi que par la génération simultanée de la parole, des sons et de la musique.
Le modèle a obtenu des résultats de pointe (state-of-the-art) dans toutes les modalités, égalant voire dépassant des modèles spécialisés, et constitue le premier modèle unifié multimodal complet en open source doté de mille milliards de paramètres. Les optimisations d’ingénierie comprennent notamment un schéma de regroupement de séquences multimodales complet et des stratégies de parallélisation flexibles, améliorant l’efficacité de l’entraînement de 67 %.
L’équipe a également exploré l’unification au niveau des représentations à travers les projets open source MingTok et MingTok-Audio, illustrant un cadre unifié pour la compréhension et la génération à la fois d’images et d’audio.
Source: InfoQ 中国 —
original
