媒体生成模型 🇺🇸 01.08.2026 12:02

MiniMax 发布 MiniMax H3:全能多模态视频模型,可生成 15 秒 2K 片段并自带立体声

MiniMaxMiniMax Google/DeepMindGoogle/DeepMind ByteDanceByteDance
MiniMax 推出了 MiniMax H3,这是一个通用的多模态生成模型,统一处理文本、图像、视频和音频,输出带有原生立体声的 2K 视频。该模型已通过 API 和海螺 AI 应用提供,并承诺不久将开放权重。定价激进,H3 在视频编辑方面领先,但在其他基准测试中落后于竞争对手。
MiniMax发布了MiniMax H3,这是一款通用多模态生成模型,能够将文本、图像、视频和音频作为统一上下文进行读取,并返回带有原生立体声音频的视频,支持2K分辨率,时长从4秒到15秒(仅限整数)。与以往需要针对文本生成视频、图像生成视频等任务分别使用独立模型的体系不同,H3将这些功能整合到单一的预训练范式中,其中的关联关系以自然语言表达,例如引用视频中的镜头移动或将人声与音频匹配。该模型于2026年7月31日推出,可通过模型ID MiniMax-H3调用API,也可在消费级应用海螺AI中使用。它面向广告、品牌推广、电子商务、产品设计、UI/UX、游戏、电影预览和零售目录媒体等场景,应用包括广告变体、产品视频、动态海报和视频到视频的动作迁移。API支持三种输入模式——文本生成视频、首帧/末帧图像生成视频以及参考生成——输入限制包括最多9张参考图像、3个参考视频(每个2-15秒,总时长≤15秒)和3个参考音频片段(音频需要附带图像或视频)。混合输入上限为12个文件;提示词≤7000个字符;请求体≤64 MB;文件大小:视频≤50 MB,图像≤30 MB,音频≤15 MB。支持的格式包括H.264/H.265视频、JPG/PNG/WEBP/HEIC/HEIF图像以及WAV/MP3音频。其性能依赖于四个技术组件:上下文全方位表示(描述关系的字幕生成,将约10万个标记压缩至约4000个)、H3-VAE(一种分词器,有效序列长度提升4倍,支持原生2K)、H3-Omni Transformer(分离理解与生成工作负载,训练吞吐量提升约30%)以及上下文再生(基础模型在上下文中再生低分辨率输出,而非附加超分辨率)。定价声明称:在2K分辨率下,每秒价格低于主流模型的三分之一;在768p分辨率下,低于主流720p模型的一半。第三方追踪器报告价格为每秒0.13美元(每条15秒视频约1.95美元),但MiniMax的按需付费页面仍列出海螺2.3的层级。根据《南华早报》援引Artificial Analysis的数据,H3在视频编辑方面领先,在文本生成视频方面落后于谷歌的Gemini Omni Flash,在图像生成视频方面落后于Seedance 2.0和Gemini Omni Flash。开放权重承诺“在未来几天内”提供,但尚未发布。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻