MiniMax H3: Het neurale netwerk dat regisseert, geluid maakt en zichzelf bewerkt
MiniMax heeft H3 (ook bekend als Hailuo 3.0) uitgebracht, een multimodal AI-model dat video genereert met gesynchroniseerd geluid, bewerkingen uitvoert volgens referentievideo's en zelfs chromakey-verwijdering aankan. Het model is open-source onder een licentie, met gewichten beschikbaar op Hugging Face, en ondersteunt tot 2K-resolutie via API. Het streeft ernaar tekst, beeld, video en audio te verenigen in één context.
MiniMax heeft H3 geïntroduceerd, ook wel bekend als Hailuo 3.0 of Hailuo 03. Dit is een multimodaal model dat video's van 4 tot 15 seconden kan genereren met 24 frames per seconde, met native stereogeluid op 32 kHz, en tot 2K-resolutie via API of 768p wanneer het zelf wordt gehost. Het model kan tot 9 referentieafbeeldingen, 3 video's en 3 audiobestanden tegelijk verwerken, en kan video's bewerken zodat ze overeenkomen met de timing en stijl van een referentieclip. Het verwijdert ook green screens en past de belichting aan. De architectuur comprimeert bronnen tot taaldescripties (waardoor ongeveer 100.000 tokens worden gereduceerd tot 4.000), gebruikt een opnieuw ontworpen VAE-tokenizer met een viervoudige toename in effectieve sequentielengte, en bevat aparte berekeningen voor begrip en generatie. MiniMax heeft de gewichten van het model op Hugging Face vrijgegeven op 2-3 augustus 2026, enkele dagen na de API-lancering op 31 juli 2026. Demonstraties tonen aan dat het model complexe prompts voor bewerkingen, reclame en naadloze overgangen aankan, maar het heeft nog steeds moeite met kleine tekst in video's, een veelvoorkomende zwakte in generatieve videomodellen.
Bron: Habr — хаб ИИ —
origineel
