MiniMax H3: Neuroverkko, joka ohjaa, tuottaa ääntä ja editoi itseään
MiniMax on julkaissut H3:n (tunnetaan myös nimellä Hailuo 3.0), monimuotoisen tekoälymallin, joka tuottaa videota synkronoidulla äänellä, suorittaa editointeja referenssivideoiden mukaisesti ja jopa hoitaa greenscreen-poiston. Malli on avoimen lähdekoodin lisenssillä julkaistu, painot saatavilla Hugging Facesta, ja se tukee jopa 2K-resoluutiota API:n kautta. Sen tavoitteena on yhdistää teksti-, kuva-, video- ja äänenkäsittely yhdeksi kontekstiksi.
MiniMax on julkaissut H3-mallin, joka tunnetaan myös nimillä Hailuo 3.0 tai Hailuo 03. Se on multimodaalinen malli, joka pystyy tuottamaan 4–15 sekunnin videoita 24 ruudun sekuntinopeudella, sisältäen natiivin stereona kuuluvan äänen 32 kilohertsin taajuudella, ja jopa 2K-resoluutiolla API:n kautta tai 768p-resoluutiolla itse ylläpidettynä. Malli voi ottaa samanaikaisesti vastaan jopa 9 referenssikuvaa, 3 videota ja 3 äänitiedostoa, ja se pystyy muokkaamaan videoita vastaamaan referenssiklipin ajoitusta ja tyyliä. Se myös poistaa greenscreen-taustoja ja säätää valaistusta. Arkkitehtuuri pakkaa lähteet kielellisiksi kuvauksiksi (vähentäen noin 100 000 tokenia 4 000:een), käyttää uudelleen suunniteltua VAE-tokenisoijaa, joka nelinkertaistaa tehollisen sekvenssipituuden, ja sisältää erilliset laskennat ymmärtämistä ja tuottamista varten. MiniMax julkaisi mallin painot Hugging Facessa 2.–3. elokuuta 2026, muutama päivä API-julkaisun jälkeen 31. heinäkuuta 2026. Demonstraatiot osoittavat mallin käsittelevän monimutkaisia kehotteita muokkausta, mainontaa ja saumattomia siirtymiä varten, mutta se kamppailee edelleen pienen tekstin kanssa videoissa, mikä on yleinen heikkous generatiivisissa videomalleissa.
Lähde: Habr — хаб ИИ —
Alkuperäinen
