媒体生成模型 🇷🇺 06.08.2026 12:01

MiniMax H3:能导、能配音、还能自我剪辑的神经网络

MiniMax 发布了 H3(又名海螺 3.0),这是一款多模态人工智能模型,能生成带同步音频的视频、依据参考视频执行剪辑操作,甚至支持绿幕移除。该模型已开源并提供许可证,权重可在 Hugging Face 上获取,通过应用程序接口(API)可支持高达 2K 分辨率。它旨在将文本、图像、视频和音频处理统一到单一上下文中。
MiniMax推出了H3,品牌名也叫Hailuo 3.0或Hailuo 03,这是一款多模态模型,能以24帧每秒的帧率生成4至15秒的视频,自带32千赫兹的原生立体声音频,通过API最高支持2K分辨率,自托管时则最高768p。该模型可同时接收多达9张参考图片、3段视频和3个音频文件,并能根据参考剪辑的节奏与风格来编辑视频。它还能去除绿幕并调整光照。其架构将源内容压缩为语言描述(将约10万个token缩减至4千个),采用重新设计的VAE分词器,使得有效序列长度提升四倍,并分别针对理解与生成进行独立计算。MiniMax于2026年8月2日至3日在Hugging Face上发布了该模型的权重,这距离2026年7月31日API上线已过去数日。演示视频展示了该模型处理复杂编辑、广告和流畅转场指令的能力,但在处理视频中的小字体文本方面仍显不足,这是生成式视频模型的常见短板。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻