PEVA:全身动作引导的自中心视频预测
来自伯克利人工智能研究所(BAIR)的研究人员提出了PEVA(从人体动作预测自中心视频)模型,该模型根据过去的帧和通过三维姿势变化指定的一系列人体动作,生成下一个第一人称视频帧。该模型使用在Nymeria数据集上训练的自回归条件扩散变换器,能够预测原子动作、模拟反事实场景,并支持长达16秒的长视频生成。PEVA还可用于规划,通过评估不同动作序列与目标图像的相似性来实现。
Berkeley Artificial Intelligence Research (BAIR)
BAIR (Berkeley AI)27.07 · 17:05
