CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion
CoVAR: 通过多模态扩散生成视频与动作用于机器人操作
机构 * University of Freiburg(弗赖堡大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Technical University of Munich(慕尼黑技术大学) ; Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)
专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV
AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。
Comments 9 pages, 7 figures