视频后期制作面临变革:MiniMax H3 让手绘变特效,多模态“编码时刻”到来
MiniMax
MiniMax 发布其首个开源视频模型 H3,将编辑、排版、转场、节奏、背景音乐和视觉效果端到端集成。用户输入文本即可获得可直接发布的视频,默认分辨率为 2K。该模型被誉为视频编辑领域的新 SOTA(当前最优水平),支持包括文本、图像、音频和视频在内的全模态输入。
MiniMax 正式发布了其下一代视频模型 MiniMax H3,这也是其首个开源视频模型。H3 打破了以往视频模型仅生成原始素材的范式,将剪辑逻辑、字幕排版、转场设计、节奏控制、背景音乐及视觉效果端到端地整合在一起。用户输入文本,即可获得可直接发布的成品视频,默认分辨率为2K。该模型受到海外开发者好评,并登顶了 Artificial Analysis 视频编辑榜单。笔者测试了 H3,发现它对用户意图的响应度很高,即使面对复杂的多镜头提示词也能准确执行。H3 在视频内文字生成方面也表现出显著进步,这通常是 AI 视频模型的常见短板。它能生成跨帧保持一致的文字,甚至理解文字与视觉内容之间的关系。此外,H3 可以接收音频片段作为对话输入,声音与画面的情绪和节奏同步,这依托于 MiniMax 在多模态语音模型方面的专长。其定价较低,2K 分辨率下每秒成本不到主流模型的三分之一。H3 支持全模态输入,即所有类型的媒体都作为模型的上下文。它采用了自定义字幕模型和 H3-Omni Transformer 架构,以实现高效的多模态处理。MiniMax 的方法基于多模态与语言的融合,通过语言将孤立的模态连接起来。H3 的开源特性使企业能够私有化部署和微调模型,以定制内容工作流,这可能会激发 IP 活力的爆发。MiniMax 有着开源模型的传统,从 M2 系列到如今的 H3,与其“智能共享”的愿景一脉相承。此次发布标志着视频生成进入了“编程时刻”,它成为了一种商业上可行的生产工具。
来源: QbitAI 量子位 —
原文
