See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations
一次观看,随后行动:基于单次视频示范的任务学习视觉-语言-行动模型
机构 * Beijing Institute of Technology(北京理工大学) ; LimX Dynamics
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 ViVLA通过单次视频示范高效学习机器人操控任务,实现跨任务和跨身体的显著性能提升。