RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Michigan(密歇根大学)
AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。