ModelleMediengenerierung 🇨🇳 31.07.2026 13:01

Videopostproduktion in Gefahr: MiniMax H3 verwandelt Handzeichnungen in Effekte – der multimodale „Coding-Moment“ ist da

MiniMaxMiniMax
MiniMax veröffentlicht sein erstes Open-Source-Videomodell H3, das Bearbeitung, Typografie, Übergänge, Tempo, Hintergrundmusik und visuelle Effekte Ende-zu-Ende integriert. Nutzer geben Text ein und erhalten ein veröffentlichungsfertiges Video mit standardmäßiger 2K-Auflösung. Das Modell wird als neuer SOTA in der Videobearbeitung gelobt und unterstützt vollständige multimodale Eingaben, einschließlich Text, Bildern, Audio und Video.
MiniMax hat offiziell sein neues Video-Modell der nächsten Generation veröffentlicht, das MiniMax H3, das gleichzeitig sein erstes Open-Source-Videomodell ist. H3 bricht mit dem bisherigen Paradigma, dass Videomodelle nur Rohmaterial erzeugen, indem es Bearbeitungslogik, Typografie, Übergangsdesign, Rhythmussteuerung, Hintergrundmusik und visuelle Effekte Ende-zu-Ende integriert. Nutzer können Text eingeben und erhalten ein fertiges, veröffentlichungsreifes Video in Standardauflösung von 2K. Das Modell wurde von Entwicklern im Ausland gut aufgenommen und führt die Rangliste von Artificial Analysis für Videobearbeitung an. Der Autor hat H3 getestet und festgestellt, dass es sehr reaktionsschnell auf die Absichten der Nutzer reagiert und sogar komplexe Multi-Shot-Prompts akkurat umsetzt. H3 zeigt auch deutliche Verbesserungen bei der Erzeugung von Text in Videos, was ein häufiger Schwachpunkt von KI-Videomodellen ist. Es kann Text erzeugen, der über Frames hinweg konsistent bleibt, und versteht sogar die Beziehung zwischen Text und visuellem Inhalt. Darüber hinaus kann H3 eine Audiodatei als Eingabe für Dialoge verwenden, wobei die Stimme auf die Emotion und den Rhythmus der Bilder abgestimmt ist, und baut dabei auf der Expertise von MiniMax bei multimodalen Sprachmodellen auf. Die Preisgestaltung ist niedrig; die Kosten pro Sekunde bei 2K-Auflösung liegen bei weniger als einem Drittel der Kosten gängiger Modelle. H3 unterstützt die Eingabe aller Modalitäten, das heißt, alle Arten von Medien sind Teil des Kontexts des Modells. Es verwendet ein benutzerdefiniertes Caption-Modell und eine H3-Omni-Transformer-Architektur für eine effiziente multimodale Verarbeitung. Der Ansatz von MiniMax basiert auf der Emergenz von multimodalen Fähigkeiten plus Sprache und verbindet isolierte Modalitäten durch Sprache. Die Open-Source-Natur von H3 ermöglicht es Unternehmen, das Modell privat bereitzustellen und für individuelle Content-Workflows zu verfeinern, was möglicherweise zu einer Welle geistigen Eigentums führen könnte. MiniMax hat eine Geschichte der Veröffentlichung von Open-Source-Modellen, von der M2-Serie bis hin zu H3, im Einklang mit seiner Vision 'Intelligence with Everyone'. Die Veröffentlichung markiert einen Wandel der Videogenerierung in einen 'Coding-Moment', in dem sie zu einem kommerziell nutzbaren Produktionswerkzeug wird.
Quelle: QbitAI 量子位 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten