ModellenMediageneratie 🇨🇳 31.07.2026 13:01

Videoproductie in gevaar: MiniMax H3 verandert met de hand getekende beelden in effecten, het multimodale 'codeermoment' is aangebroken

MiniMaxMiniMax
MiniMax brengt zijn eerste open-source videomodel uit, H3, dat end-to-end bewerking, typografie, overgangen, tempo, achtergrondmuziek en visuele effecten integreert. Gebruikers kunnen tekst invoeren en krijgen een kant-en-klare video, met standaard 2K-resolutie. Het model wordt geprezen als een nieuwe SOTA in videobewerking en ondersteunt volledige multimodale invoer, waaronder tekst, afbeeldingen, audio en video.
MiniMax heeft officieel zijn nieuwste videomodel uitgebracht, MiniMax H3, dat tevens het eerste open-source videomodel van het bedrijf is. H3 doorbreekt het eerdere paradigma waarbij videomodellen alleen ruwe beelden genereerden, door end-to-end montagelogica, typografie, overgangsontwerp, ritmebesturing, achtergrondmuziek en visuele effecten te integreren. Gebruikers kunnen tekst invoeren en een kant-en-klaar video ontvangen die klaar is voor publicatie, standaard in 2K-resolutie. Het model is goed ontvangen door buitenlandse ontwikkelaars en staat bovenaan de Artificial Analysis-ranglijst voor videobewerking. De auteur testte H3 en ontdekte dat het zeer responsief is op de intentie van de gebruiker, zelfs complexe prompts met meerdere shots nauwkeurig volgt. H3 laat ook een significante verbetering zien in het genereren van tekst in video's, een veelvoorkomend probleem voor AI-videomodellen. Het kan tekst genereren die consistent blijft tussen frames en begrijpt zelfs de relatie tussen tekst en visuele inhoud. Daarnaast kan H3 een audioclip als invoer gebruiken voor dialoog, waarbij de stem is afgestemd op de emotie en het ritme van de beelden, voortbouwend op de expertise van MiniMax op het gebied van multimodale spraakmodellen. De prijs is laag, met kosten per seconde bij 2K-resolutie die minder dan een derde bedragen van gangbare modellen. H3 ondersteunt volledige modale invoer, wat betekent dat alle soorten media deel uitmaken van de context van het model. Het gebruikt een aangepast bijschriftmodel en een H3-Omni Transformer-architectuur voor efficiënte multimodale verwerking. De aanpak van MiniMax is gebaseerd op de opkomst van multimodaal plus taal, waarbij geïsoleerde modaliteiten via taal worden verbonden. De open-source aard van H3 stelt bedrijven in staat om het model privé te implementeren en fijn te stemmen voor aangepaste contentworkflows, wat mogelijk kan leiden tot een explosie van intellectueel-eigendomsvitaliteit. MiniMax heeft een geschiedenis van het open-sourcen van modellen, van de M2-serie tot nu H3, in lijn met de visie van 'Intelligence with Everyone'. De release markeert een verschuiving van videogeneratie naar een 'codeermoment', waarbij het een commercieel levensvatbaar productietool wordt.
Bron: QbitAI 量子位 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws