MiniMax veröffentlicht MiniMax H3: Omni-modales Videomodell erzeugt 15-Sekunden-Clips in 2K mit nativem Stereo-Audio
MiniMax
Google/DeepMind
ByteDance
MiniMax hat MiniMax H3 vorgestellt, ein universelles multimodales Generierungsmodell, das Text, Bild, Video und Audio vereint und 2K-Videos mit nativem Stereo-Sound ausgibt. Das Modell ist über die API und in der Hailuo-AI-App verfügbar, Open-Weights-Versionen sollen bald folgen. Preislich aggressiv positioniert, führt H3 bei der Videobearbeitung, bleibt aber hinter Mitbewerbern bei anderen Benchmarks zurück.
MiniMax hat MiniMax H3 veröffentlicht, ein multimodales Generierungsmodell für allgemeine Zwecke, das Text, Bilder, Videos und Audio als einheitlichen Kontext liest und Videos mit nativem Stereo-Audio zurückgibt. Es unterstützt 2K-Auflösung und Dauern von 4 bis 15 Sekunden (nur ganze Zahlen). Anders als frühere Stacks, die separate Modelle für Text-zu-Video, Bild-zu-Video und andere Aufgaben benötigten, fasst H3 diese in einem einzigen Vortrainings-Paradigma zusammen, in dem Beziehungen in natürlicher Sprache ausgedrückt werden, wie zum Beispiel das Referenzieren von Kamerabewegungen aus einem Video oder das Abstimmen von Gesang auf Audio. Das Modell wurde am 31. Juli 2026 veröffentlicht und ist über die API unter der Modell-ID MiniMax-H3 sowie in der Verbraucher-App Hailuo AI verfügbar. Es ist für Werbung, Markenbildung, E-Commerce, Produktdesign, UI/UX, Gaming, Film-Previsualisierung und Einzelhandelskatalogmedien positioniert, mit Anwendungen wie Anzeigenvarianten, Produktvideos, animierten Postern und Video-zu-Video-Bewegungsübertragung. Die API unterstützt drei Einstiegsmodi: Text-zu-Video, Erstes/Letztes-Bild-Bild-zu-Video und Referenzgenerierung, mit Eingabebeschränkungen einschließlich bis zu 9 Referenzbildern, 3 Referenzvideos (jeweils 2-15 s, insgesamt ≤15 s) und 3 Referenzaudioclips (Audio erfordert begleitendes Bild/Video). Gemischte Eingaben sind auf 12 Dateien begrenzt; Eingabeaufforderungen ≤7.000 Zeichen; Anforderungstext ≤64 MB; Dateigrößen: Video ≤50 MB, Bild ≤30 MB, Audio ≤15 MB. Unterstützte Formate umfassen H.264/H.265-Video, JPG/PNG/WEBP/HEIC/HEIF-Bilder und WAV/MP3-Audio. Vier technische Komponenten ermöglichen seine Leistung: Contextual Omni Representation (Beschriftung, die Beziehungen beschreibt und ~100.000 Tokens auf ~4.000 destilliert), H3-VAE (ein Tokenizer mit 4-fachem effektiven Sequenzlängen-Gewinn, der natives 2K ermöglicht), H3-Omni Transformer (trennt Verständnis- und Generierungsaufgaben, was den Trainingsdurchsatz um ~30% steigert) und In-Context Regeneration (das Basismodell regeneriert Low-Resolution-Ausgaben im Kontext, anstatt Super-Resolution nachzurüsten). Preisangaben: Bei 2K liegt der Preis pro Sekunde unter einem Drittel der Mainstream-Modelle; bei 768p unter der Hälfte des Mainstream-720p. Drittanbieter-Tracker berichten von 0,13 $ pro Sekunde (~1,95 $ pro 15-Sekunden-Clip), aber die Pay-as-you-go-Seite von MiniMax listet weiterhin Hailuo-2.3-Tarife. Laut SCMP, das sich auf Artificial Analysis beruft, führt H3 bei der Videobearbeitung, liegt bei Text-zu-Video hinter Googles Gemini Omni Flash und bei Bild-zu-Video hinter Seedance 2.0 und Gemini Omni Flash. Offene Gewichte sind 'in den kommenden Tagen' versprochen, aber noch nicht veröffentlicht.
Quelle: MarkTechPost —
Original
