ModelleForschung 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni: Schlüsseltechnologien und Praktiken eines einheitlichen Vollmodality-Modells

Auf dem QCon Beijing 2026 erläuterte Guo Qingpei, Senior Algorithmus-Experte bei Ant Group, die Entwicklung von Ming-Flash-Omni, einem einheitlichen Modell mit einer Billion Parametern für alle Modalitäten. Der Vortrag behandelte eine einheitliche Architektur mit Multi-Router und AnyExperts, eine kollaborative Trainingsstrategie sowie technische Optimierungen, die Spitzenergebnisse über alle Modalitäten hinweg erzielen.
Guo Qingpei von Ant Group präsentierte auf der QCon Global Software Development Conference 2026 in Peking die technische Architektur und Praxis hinter Ming-Flash-Omni, einem vollständig modalen, einheitlichen Modell mit mehreren hundert Milliarden Parametern. Das Modell vereint das Verständnis und die Generierung von Audio, Video, Bildern und Text in einem einzigen Rahmenwerk. Um die Modalitätsvereinheitlichung zu adressieren, entwarf das Team einen Multi-Router-Mechanismus für die modalspezifische Expertenweiterleitung sowie AnyExperts, die Experten dynamisch basierend auf der Token-Bedeutung zuweisen und so Redundanz bei Bild- und Video-Token reduzieren. Zudem führten sie eine kollaborative Trainingsstrategie mit Datenverhältnis-Planung und dynamischer Lernraten-Anpassung basierend auf der Konvergenzgeschwindigkeit ein. Für die Aufgabenvereinheitlichung bauten sie auf einem eingefrorenen multimodalen Verständnis-Backbone auf, fügten Bildgenerierungs- und Sprachsynthesefähigkeiten hinzu, ergänzt durch feinkörniges visuelles Wissen durch generative Segmentierungstraining, einen Zweistrom-Informationsansatz für die Identitätserhaltung und die separate Extraktion typografischer Merkmale, um verstümmelten Text zu vermeiden. Die Sprachgenerierung wurde um Dialekt-, Emotions- und individuelle Klangfarbensteuerungen erweitert sowie die gleichzeitige Generierung von Sprache, Geräuschen und Musik. Das Modell erzielte modernste Ergebnisse über alle Modalitäten hinweg, erreichte oder übertraf spezialisierte Modelle und ist das erste quelloffene Modell mit einer Billion Parametern für alle Modalitäten. Zu den technischen Optimierungen gehörten ein Schema für die Packung vollständig modaler Sequenzen und flexible Parallelstrategien, wodurch die Trainingseffizienz um 67 Prozent gesteigert wurde. Das Team erforschte auch die Vereinheitlichung auf Repräsentationsebene mit den Open-Source-Projekten MingTok und MingTok-Audio und demonstrierte ein einheitliches Rahmenwerk für das Verständnis und die Generierung von Bildern und Audio.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten