论文导读
亚马逊FAR、加州大学伯克利分校、斯坦福大学等机构提出EyeRobot 2.0,让机器人像人一样按操作进度转动视线,只靠一套立体相机完成精细双手任务。物体遮挡腕部视野时,它的成功率达到48%,对照为22%。插吸管、合笔盖这些近距离动作,可以把看哪里与手伸向哪里分开。
先看杯子,再看吸管入口
机器人把吸管插进饮料杯,难点不只在手指精度。杯子、吸管和入口会先后成为最重要的观察目标,夹爪抓住物体时还可能挡住装在手腕上的镜头。看不到关键位置,动作策略就缺少下一步判断所需的信息。
EyeRobot 2.0保留一套立体视觉装置,让两个视点转向同一个三维注视目标。这里的“只靠立体相机”不等于摄像头始终不动:主动转动视线正是系统的主要设计。团队把视觉注意力从夹爪的位置中分离出来。
相机看向目标后,画面中心获得更多计算资源,外围区域保留较粗的观察。这样可以看清插入口附近的小变化,避免对整幅高清画面投入同样多的计算。
图:三阶段注视目标、双手机器人和相机局部画面。
任务进行到哪,视线就换到哪
团队先教会底层控制器持续盯住指定物体,再训练另一套选择机制,按照任务进度切换目标。注视序列由训练得到,并非把所有阶段的镜头角度逐一写死。
合上笔盖、移动袋子、装入记号笔、拉上拉链,需要关注的对象不同。论文展示的注视目标会在笔和袋子之间切换,让视线为当前动作服务。与此同时,夹爪状态和动作改用相对注视位置的坐标表达,减少视角变化对动作学习的干扰。
这两部分配合,才能让主动相机成为控制系统的一环。只在机器人头部加一个能转动的镜头,不会自动得到论文中的效果。
图:记号笔装袋过程与各阶段注视目标的变化。
遮挡时48%对22%,清晰时69%对64%
实验包括七项真实桌面任务和六项模拟任务,累计超过1000次实机、1800次模拟试验。作者使用相同示范数据训练不同视觉配置,检查主动视线能否补上移除腕部相机后的差距。
腕部画面清晰的一组任务中,EyeRobot成功率为69%,带腕部视角的对照为64%;抓住的物体挡住腕部镜头时,两者为48%和22%。这里比较的是不同可见性任务组,不能把两个数字组混成所有任务的统一成绩。
实验还检查了画面中心的精细处理和立体输入。去掉这些设计,真实任务平均成功率均下降。结果支持的是整套观察和控制方案,并不说明腕部相机在任何场景都可以取消。
下图汇总不同视觉配置在各项真实、模拟任务与平均成绩上的成功率;前述遮挡分组和精细处理消融由论文另行列出的表格核验。
图:真实与模拟任务上不同视觉配置的完整成功率。
下一步:把相机布局纳入操作设计
对需要抓住较大物体、使用工具或跨工作台操作的机器手,视线能独立于夹爪运动,是一种值得进一步测试的相机布局。项目演示提供了具体动作过程,可以观察目标如何随任务切换。
后续还要扩大任务范围,检查新物体、新空间和更长操作链中的表现。当前结果来自受控实验,移动底盘、复杂遮挡和动态环境仍需要各自验证。主动注视提供了相机与操作策略联合设计的实测起点。
参考资料
https://arxiv.org/abs/2610.03710