ModelRiset 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni: Teknologi Kunci dan Praktik Model Full-Modalitas Terpadu

Pada QCon Beijing 2026, pakar algoritma senior Ant Group, Guo Qingpei, memaparkan pengembangan Ming-Flash-Omni, sebuah model terpadu full-modalitas dengan parameter triliunan. Sesi ini mencakup arsitektur terpadu dengan multi-router dan AnyExperts, strategi pelatihan kolaboratif, serta optimasi rekayasa, yang mencapai hasil terbaik di berbagai modalitas.
Guo Qingpei dari Ant Group memaparkan arsitektur teknis dan praktik di balik Ming-Flash-Omni, sebuah model terpadu multimodal penuh dengan parameter ratusan miliar, pada Konferensi Pengembangan Perangkat Lunak Global QCon Beijing 2026. Model ini menyatukan tugas pemahaman dan generasi audio, video, gambar, dan teks dalam satu kerangka kerja. Untuk mengatasi penyatuan modalitas, tim merancang mekanisme multi-router untuk menangani perutean pakar khusus modalitas dan AnyExperts, yang mengalokasikan pakar secara dinamis berdasarkan tingkat kepentingan token, mengurangi redundansi pada token gambar dan video. Mereka juga memperkenalkan strategi pelatihan kolaboratif dengan perencanaan rasio data dan penyesuaian laju pembelajaran dinamis berdasarkan kecepatan konvergensi. Untuk penyatuan tugas, mereka membangun di atas kerangka pemahaman multimodal yang dibekukan, menambahkan kemampuan generasi gambar dan sintesis ucapan, dilengkapi dengan pengetahuan visual yang terperinci melalui pelatihan segmentasi generatif, pendekatan informasi aliran ganda untuk mempertahankan identitas, dan ekstraksi terpisah fitur tipografi untuk menghindari teks yang rusak. Generasi ucapan ditingkatkan dengan kontrol dialek, emosi, dan timbre kustom, serta generasi simultan ucapan, suara, dan musik. Model ini mencapai hasil mutakhir di semua modalitas, setara atau melampaui model khusus, dan merupakan model terpadu multimodal penuh dengan parameter triliunan pertama yang bersumber terbuka. Optimasi teknik mencakup skema pengepakan urutan multimodal penuh dan strategi paralel yang fleksibel, meningkatkan efisiensi pelatihan sebesar 67%. Tim juga mengeksplorasi penyatuan tingkat representasi dengan proyek sumber terbuka MingTok dan MingTok-Audio, menunjukkan kerangka kerja terpadu untuk pemahaman dan generasi gambar serta audio.
Sumber: InfoQ 中国 — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru