Kandinsky WM 1.0:面向物理人工智能的生成模型
Сбер
NVIDIA
Meta
Sber公司发布了Kandinsky WM 1.0,这是一套由三个图像到视频模型组成的系列,专为自动驾驶、机器人技术和复杂物理场景而设计。这些模型基于Kandinsky 5.0 Video Lite,以MIT许可证提供,旨在通过生成物理准确的合成视频来解决物理人工智能中的数据稀缺问题。
Sber 已开源 Kandinsky WM 1.0,这是一套针对物理 AI 的三个专用视频生成模型:用于自动驾驶的 K5-AV、用于机器人技术的 K5-RO,以及用于复杂物理场景的 K5-PH。这些模型基于 20 亿参数的 Kandinsky 5.0 Video Lite,采用图像转视频模式运行,接收首帧和文本提示以生成后续内容。每个模型都在特定数据集上进行了领域适配:来自 NVIDIA PhysicalAI 自动驾驶的 150 万段视频,来自多种来源(包括 GenRobot 10Kh RealOmni 和 AgiBot World Beta)的 220 万段机器人视频,以及包含预训练 130 万段和人工精选 30 万段的 160 万段物理视频。领域适配后,模型进入了第二阶段训练:K5-AV 和 K5-RO 使用带奖励模型的强化学习,K5-PH 使用 SOAR。此次发布包含 MIT 许可下的代码和权重。文章还强调了物理 AI 中的长尾数据问题,即稀有场景至关重要但难以收集,并指出当前的视频生成模型往往缺乏物理真实感,因此需要进行领域专属训练和训练后处理。
来源: Habr — хаб ML —
原文
