ModellerAraştırma 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni: Tek Birleşik Tam Modallık Modelinin Temel Teknolojileri ve Uygulamaları

QCon Pekin 2026'da, Ant Group kıdemli algoritma uzmanı Guo Qingpei, bin milyar parametreli tam modallık birleşik modeli Ming-Flash-Omni'nin geliştirilmesini detaylandırdı. Konuşma, çoklu yönlendirici ve AnyExperts ile birleşik mimari, işbirlikçi eğitim stratejisi ve mühendislik optimizasyonlarını kapsayarak, modallar genelinde en son teknoloji sonuçlarına ulaşmayı hedefledi.
Ant Group'tan Guo Qingpei, QCon Global Software Development Conference 2026 Beijing'de, yüzlerce milyar parametreli tam modaliteli birleşik model Ming-Flash-Omni'nin arkasındaki teknik mimariyi ve uygulama pratiklerini sundu. Model, ses, video, görüntü ve metin anlama işlevlerini üretim görevleriyle tek bir çerçevede birleştiriyor. Modalite birleştirmesini sağlamak için ekip, modaliteye özgü uzman yönlendirmesini yönetmek amacıyla bir çoklu yönlendirici (multi-router) mekanizması ve token önemine göre uzmanları dinamik olarak tahsis ederek görüntü ve video token'larındaki fazlalığı azaltan AnyExperts mekanizmasını tasarladı. Ayrıca, veri oranı planlaması ve yakınsama hızına dayalı dinamik öğrenme oranı ayarlaması içeren işbirlikçi bir eğitim stratejisi geliştirdiler. Görev birleştirmesi için, dondurulmuş bir çok-modlu anlama omurgası üzerine inşa ederek görüntü üretimi ve konuşma sentezi yeteneklerini eklediler; bunu üretken segmentasyon eğitimi yoluyla ince taneli görsel bilgiyle, kimlik korunumu için çift akışlı bir bilgi yaklaşımıyla ve bulanık/karışık metin oluşumunu önlemek amacıyla tipografik özelliklerin ayrı çıkarımıyla destekledi. Konuşma üretimi; lehçe, duygu ve özel ses tonu (timbre) kontrolleriyle ve konuşma, ses efekti ile müziğin eş zamanlı üretimiyle güçlendirildi. Model, tüm modalitelerde son teknoloji (state-of-the-art) sonuçlar elde ederek özel amaçlı modellerle eşleşti veya onları geride bıraktı ve açık kaynaklı ilk trilyon parametreli tam modaliteli birleşik model oldu. Mühendislik optimizasyonları arasında tam modaliteli dizi paketleme (sequence packing) şeması ve esnek paralel stratejiler yer aldı; bu sayede eğitim verimliliği %67 artırıldı. Ekip ayrıca, açık kaynaklı MingTok ve MingTok-Audio projeleriyle temsil düzeyinde birleştirmeyi de araştırdı ve hem görüntü hem de ses anlama ile üretimi için birleşik bir çerçeve ortaya koydu.
Kaynak: InfoQ 中国 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler