PEVA:从全身动作预测第一人称视频
Berkeley Artificial Intelligence Research (BAIR)
来自BAIR(伯克利人工智能)的研究人员推出了PEVA模型,该模型能够从人类全身动作预测第一人称视频帧。它使用在Nymeria数据集上训练的自回归条件扩散变压器,实现原子动作合成、反事实模拟和长视频生成。PEVA还可通过优化动作序列用于视觉规划。
PEVA(通过人类行为预测自我中心视频)是BAIR开发的一个模型,它根据过去的帧和一系列表示为48维运动学姿态轨迹的全身动作序列,生成未来的自我中心视频帧。该模型扩展了条件扩散变换器,采用了随机时间跳跃、序列级训练和动作嵌入。在Nymeria数据集(该数据集将自我中心视频与身体姿态捕捉配对)上训练后,PEVA能够模拟原子动作、反事实情况以及长达16秒的视频滚动。它还支持通过使用交叉熵方法优化动作序列以最小化与目标图像的感知相似度,从而实现规划。该模型在感知质量上优于基线模型,并展现出随模型大小扩展的特性。
来源: BAIR (Berkeley AI) —
原文
