MediatuotantoMallit 🇺🇸 01.08.2026 12:02

MiniMax julkaisee MiniMax H3 -mallin: omnimodaalinen videomalli tuottaa 15 sekunnin 2K-leikkeitä natiivilla stereoäänellä

MiniMaxMiniMax Google/DeepMindGoogle/DeepMind ByteDanceByteDance
MiniMax on julkaissut MiniMax H3:n, yleiskäyttöisen multimodaalisen generointimallin, joka yhdistää tekstin, kuvan, videon ja äänen käsittelyn ja tuottaa 2K-videota natiivilla stereoäänellä. Malli on saatavilla API:n kautta ja Hailuo AI -sovelluksessa, ja avoimet painot ovat luvassa pian. Aggressiivisesti hinnoiteltu H3 johtaa videomuokkauksessa, mutta jää kilpailijoista jälkeen muissa vertailuissa.
MiniMax julkaisi MiniMax H3 -mallin, yleiskäyttöisen multimodaalisen generointimallin, joka lukee tekstiä, kuvia, videota ja ääntä yhtenäisenä kontekstina ja tuottaa videota, jossa on natiivi stereoääni, tukien 2K-resoluutiota ja 4–15 sekunnin kestoja (vain kokonaislukuja). Toisin kuin aiemmat pinot, jotka vaativat erillisiä malleja tekstistä videoksi, kuvasta videoksi ja muihin tehtäviin, H3 yhdistää nämä yhteen esikoulutusparadigmaan, jossa suhteet ilmaistaan luonnollisella kielellä, kuten viittaamalla kameran liikkeeseen videosta tai sovittamalla laulun ääneen. Malli julkaistiin 31. heinäkuuta 2026, ja se on saatavilla API:n kautta mallitunnuksella MiniMax-H3 sekä kuluttajasovelluksessa Hailuo AI. Se on suunnattu mainontaan, brändäykseen, verkkokauppaan, tuotesuunnitteluun, käyttöliittymä- ja käyttökokemussuunnitteluun, pelaamiseen, elokuvien esivisualisointiin ja vähittäiskaupan kuvastomediaan, ja sovelluksia ovat muun muassa mainosvariantit, tuotevideot, animoidut julisteet ja videosta videoksi liikkeen siirto. API tukee kolmea syöttötapaa: tekstistä videoksi, ensimmäisen/viimeisen kehyksen kuvasta videoksi ja referenssigenerointi. Syöttörajoituksiin kuuluu enintään 9 referenssikuvaa, 3 referenssivideota (2–15 sekuntia kukin, yhteensä enintään 15 sekuntia) ja 3 referenssiäänileikettä (ääni vaatii mukana olevan kuvan/videon). Sekasyöttö on rajattu 12 tiedostoon; kehotteet enintään 7 000 merkkiä; pyynnön runko enintään 64 megatavua; tiedostokoot: video enintään 50 megatavua, kuva enintään 30 megatavua, ääni enintään 15 megatavua. Formaatit sisältävät H.264/H.265-videon, JPG/PNG/WEBP/HEIC/HEIF-kuvat ja WAV/MP3-äänen. Neljä teknistä komponenttia mahdollistavat sen suorituskyvyn: Contextual Omni Representation (kuvailu, joka kuvaa suhteita, tiivistää noin 100 000 tokenia noin 4 000 tokeniin), H3-VAE (tokenisoija, jolla on 4-kertainen efektiivinen sekvenssin pituuden lisäys mahdollistaen natiivin 2K), H3-Omni Transformer (erottaa ymmärtämis- ja generointityöt, lisää koulutuksen läpimenoa noin 30 %) ja In-Context Regeneration (perusmalli regeneroi matalaresoluutioisen tuloksen kontekstissa sen sijaan, että se liitettäisiin superresoluutioon). Hinnoitteluväitteet: 2K-resoluutiolla sekuntihinta on alle kolmannes valtavirran malleista; 768p-resoluutiolla alle puolet valtavirran 720p-hinnasta. Kolmannen osapuolen seurantasivustot raportoivat 0,13 dollaria sekunnilta (noin 1,95 dollaria 15 sekunnin leikkeestä), mutta MiniMaxin pay-as-you-go-sivu listaa edelleen Hailuo 2.3 -tasot. SCMP:n mukaan Artificial Analysisiin viitaten H3 johtaa videoiden muokkauksessa, on jäljessä Googlen Gemini Omni Flashista tekstistä videoksi -tehtävässä ja on Seedance 2.0:n ja Gemini Omni Flashin takana kuvasta videoksi -tehtävässä. Avoimet painot on luvattu 'tulevina päivinä', mutta niitä ei ole vielä julkaistu.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset