MiniMax H3: Yönlendiren, Ses Üreten ve Kendini Düzenleyen Sinir Ağı
MiniMax, senkronize ses ile video oluşturan, referans videoları takip ederek düzenlemeler yapan ve hatta yeşil ekran arındırma işlemlerini gerçekleştiren çok modlu bir yapay zeka modeli olan H3'ü (Hailuo 3.0 olarak da bilinir) yayınladı. Model, bir lisans altında açık kaynak olarak sunuldu; ağırlıklar Hugging Face'te mevcut ve API aracılığıyla 2K çözünürlüğe kadar destekliyor. Metin, görüntü, video ve ses işlemeyi tek bir bağlamda birleştirmeyi amaçlıyor.
MiniMax, H3'ü (Hailuo 3.0 veya Hailuo 03 olarak da bilinir) tanıttı. Bu, 24 fps'de 4-15 saniyelik videoları, 32 kHz'de doğal stereo ses ile ve API üzerinden 2K çözünürlüğe kadar ya da kendi kendine barındırıldığında 768p çözünürlükte üretebilen çok modlu bir modeldir. Model, aynı anda 9 referans görsel, 3 video ve 3 ses dosyası alabilir ve videoları bir referans klibin zamanlamasına ve stiline uyacak şekilde düzenleyebilir. Ayrıca yeşil ekranları kaldırır ve aydınlatmayı ayarlar. Mimari, kaynakları dil açıklamalarına sıkıştırır (yaklaşık 100 bin token'ı 4 bin token'a düşürür), dört kat daha uzun efektif dizi uzunluğuna sahip yeniden tasarlanmış bir VAE tokenizer kullanır ve anlama ile üretim için ayrı hesaplama içerir. MiniMax, modelin ağırlıklarını 2-3 Ağustos 2026'da Hugging Face'te yayınladı; bu, 31 Temmuz 2026'daki API lansmanından birkaç gün sonraydı. Gösterimler, modelin düzenleme, reklamcılık ve kusursuz geçişler için karmaşık komutları ele aldığını gösteriyor, ancak üretken video modellerinde yaygın bir zayıflık olan video üzerindeki küçük metinlerle hâlâ zorlanıyor.
Kaynak: Habr — хаб ИИ —
orijinal
