MiniMax brengt MiniMax H3 uit: Omnimodaal videomodel dat 15 seconden durende 2K-clips genereert met native stereogeluid
MiniMax
Google/DeepMind
ByteDance
MiniMax heeft MiniMax H3 onthuld, een algemeen multimodaal generatiemodel dat tekst, beeld, video en audio verenigt, en 2K-video met native stereogeluid produceert. Het model is beschikbaar via API en in de Hailuo AI-app, met open gewichten die binnenkort worden beloofd. Agressief geprijsd, leidt H3 in videobewerking, maar blijft achter bij concurrenten op andere benchmarks.
MiniMax heeft MiniMax H3 uitgebracht, een multimodaal generatiemodel voor algemeen gebruik dat tekst, afbeeldingen, video en audio als één uniforme context leest en video retourneert met native stereogeluid, met ondersteuning voor 2K-resolutie en een duur van 4 tot 15 seconden (alleen gehele getallen). In tegenstelling tot eerdere stacks die afzonderlijke modellen vereisten voor tekst-naar-video, beeld-naar-video en andere taken, verenigt H3 deze in één pretraining-paradigma waarin relaties in natuurlijke taal worden uitgedrukt, zoals het verwijzen naar camerabewegingen uit een video of het matchen van vocalen aan audio. Het model werd gelanceerd op 31 juli 2026 en is beschikbaar via API onder de model-ID MiniMax-H3 en in de consumentenapp Hailuo AI. Het is gepositioneerd voor reclame, branding, e-commerce, productontwerp, UI/UX, gaming, film-previsualisatie en retailcatalogusmedia, met toepassingen zoals advertentievarianten, productvideo's, geanimeerde posters en video-naar-video-bewegingsoverdracht. De API ondersteunt drie invoermodi: tekst-naar-video, eerste/laatste-frame beeld-naar-video en referentiegeneratie, met invoerlimieten zoals maximaal 9 referentieafbeeldingen, 3 referentievideo's (elk 2-15 seconden, totaal ≤15 seconden) en 3 referentieaudioclips (audio vereist bijbehorende afbeelding/video). Gemengde invoer is beperkt tot 12 bestanden; prompts ≤7000 tekens; verzoekshoofdtekst ≤64 MB; bestandsgroottes: video ≤50 MB, afbeelding ≤30 MB, audio ≤15 MB. Formaten omvatten H.264/H.265-video, JPG/PNG/WEBP/HEIC/HEIF-afbeeldingen en WAV/MP3-audio. Vier technische componenten maken de prestaties mogelijk: Contextual Omni Representation (bijschrijving die relaties beschrijft en ~100K tokens distilleert tot ~4K), H3-VAE (een tokenizer met een effectieve sequentielengtewinst van 4× die native 2K mogelijk maakt), H3-Omni Transformer (scheidt begrip- en generatiewerkzaamheden, waardoor de trainingdoorvoer met ~30% toeneemt) en In-Context Regeneration (het basismodel regenereert lage-resolutie-output in-context in plaats van superresolutie toe te voegen). Prijsclaims: bij 2K is de prijs per seconde minder dan een derde van mainstream-modellen; bij 768p minder dan de helft van mainstream 720p. Trackingdiensten van derden rapporteren $0,13 per seconde (~$1,95 per clip van 15 seconden), maar de pay-as-you-go-pagina van MiniMax vermeldt nog steeds Hailuo 2.3-tarieven. Volgens SCMP, onder vermelding van Artificial Analysis, leidt H3 op het gebied van videobewerking, loopt het achter op Google's Gemini Omni Flash bij tekst-naar-video en staat het achter Seedance 2.0 en Gemini Omni Flash bij beeld-naar-video. Open weights zijn beloofd 'in de komende dagen', maar zijn nog niet vrijgegeven.
Bron: MarkTechPost —
origineel
