模型开源 🇩🇪 03.08.2026 17:02

MiniMax H3 成为首个登顶视频编辑排行榜的开源视频模型

MiniMaxMiniMax ByteDanceByteDance
MiniMax 已发布其视频模型 H3 的权重,使其成为首个登顶视频排行榜的开源模型。据 Artificial Analysis 显示,H3 在视频编辑方面排名第一,在文本转视频方面排名第二,在图像转视频方面排名第三。这个拥有 330 亿参数的模型能够联合处理文本、图像、视频和音频,生成带有立体声的片段,但部分组件仍保持闭源。
MiniMax 已将其视频模型 H3 的权重公开发布,标志着开放模型首次登顶视频排行榜。在 Artificial Analysis 上,H3 在视频编辑领域排名第一,在文本生成视频领域排名第二,在图像生成视频领域排名第三。这个拥有 330 亿参数的模型联合处理文本、图像、视频和音频,可生成时长为 4 到 15 秒的带有立体声的片段。根据模型卡,它每个提示词最多可处理 9 张参考图像、3 个视频片段和 3 个音频片段。不过,有两个组件仍然封闭:用于 2K 分辨率的模块和 H3-Context-IR(它将提示词和参考材料转换为结构化的中间形式)。在 ComfyUI 本地使用时,这会导致输出为 768p 分辨率,但上下文处理可以通过已发布的提示指南进行复制。开放的权重还允许进行微调,例如针对自己的素材、角色或一致的外观进行微调,但许可证仅允许收入低于 2000 万美元的公司进行商业使用。与此同时,字节跳动发布了封闭的 Seedance 2.5,该模型可生成长达 30 秒且带音频的片段。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻