MiniMax H3: Das neuronale Netz, das Regie führt, Ton erzeugt und sich selbst bearbeitet
MiniMax hat H3 (auch bekannt als Hailuo 3.0) veröffentlicht, ein multimodales KI-Modell, das Videos mit synchronisiertem Audio generiert, Bearbeitungen gemäß Referenzvideos durchführt und sogar Greenscreen-Entfernung beherrscht. Das Modell ist unter einer Lizenz als Open Source verfügbar, die Gewichte sind auf Hugging Face erhältlich, und über die API werden bis zu 2K-Auflösungen unterstützt. Ziel ist es, Text, Bild, Video und Audio in einem einzigen Kontext zu vereinen.
MiniMax hat H3 vorgestellt, das auch unter den Markennamen Hailuo 3.0 oder Hailuo 03 bekannt ist. Es handelt sich um ein multimodales Modell, das Videos mit einer Länge von 4 bis 15 Sekunden bei 24 Bildern pro Sekunde und nativem Stereo-Audio mit 32 kHz erzeugen kann. Über die API sind Auflösungen bis zu 2K möglich, bei selbst gehostetem Betrieb 768p. Das Modell kann gleichzeitig bis zu 9 Referenzbilder, 3 Videos und 3 Audiodateien verarbeiten und Videos so bearbeiten, dass sie Timing und Stil eines Referenzclips entsprechen. Es entfernt auch Green-Screens und passt die Beleuchtung an. Die Architektur komprimiert Quellen in Sprachbeschreibungen (Reduzierung von etwa 100.000 Token auf 4.000), verwendet einen neu gestalteten VAE-Tokenizer mit einer Vervierfachung der effektiven Sequenzlänge und umfasst getrennte Berechnungen für Verständnis und Generierung. MiniMax hat die Gewichte des Modells am 2. und 3. August 2026 auf Hugging Face veröffentlicht, einige Tage nach dem API-Start am 31. Juli 2026. Demonstrationen zeigen, dass das Modell komplexe Aufforderungen für Bearbeitung, Werbung und nahtlose Übergänge bewältigt, aber es hat weiterhin Schwierigkeiten mit kleinem Text in Videos, eine häufige Schwäche generativer Videomodelle.
Quelle: Habr — хаб ИИ —
Original
