Generasi MediaModel 🇷🇺 06.08.2026 12:01

MiniMax H3: Jaringan Saraf yang Mengarahkan, Menghasilkan Suara, dan Mengedit Dirinya Sendiri

MiniMax telah merilis H3 (juga dikenal sebagai Hailuo 3.0), sebuah model AI multimodal yang menghasilkan video dengan audio yang tersinkronisasi, melakukan pengeditan mengikuti video referensi, dan bahkan menangani penghapusan layar hijau. Model ini bersifat open-source di bawah lisensi tertentu, dengan bobot tersedia di Hugging Face, dan mendukung resolusi hingga 2K melalui API. Model ini bertujuan untuk menyatukan pemrosesan teks, gambar, video, dan audio ke dalam satu konteks.
MiniMax telah memperkenalkan H3, yang juga dikenal sebagai Hailuo 3.0 atau Hailuo 03, sebuah model multimodal yang mampu menghasilkan video berdurasi 4-15 detik pada 24 fps dengan audio stereo asli pada 32 kHz, serta resolusi hingga 2K melalui API atau 768p ketika di-host sendiri. Model ini dapat menerima hingga 9 gambar referensi, 3 video, dan 3 file audio secara bersamaan, serta dapat mengedit video agar sesuai dengan waktu dan gaya dari klip referensi. Model ini juga menghilangkan layar hijau dan menyesuaikan pencahayaan. Arsitekturnya mengompresi sumber menjadi deskripsi bahasa (mengurangi sekitar 100 ribu token menjadi 4 ribu), menggunakan tokenizer VAE yang didesain ulang dengan peningkatan empat kali lipat dalam panjang urutan efektif, dan mencakup komputasi terpisah untuk pemahaman dan generasi. MiniMax merilis bobot model di Hugging Face pada 2-3 Agustus 2026, beberapa hari setelah peluncuran API pada 31 Juli 2026. Demonstrasi menunjukkan model menangani prompt yang kompleks untuk pengeditan, iklan, dan transisi mulus, tetapi masih kesulitan dengan teks kecil pada video, sebuah kelemahan umum pada model video generatif.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru