arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

摄像头一挪机器人就失手,ARGUS先把画面统一到同一机位

arXiv 2608.05579 cs.RO

训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。

论文报告,在视角多样数据上,ARGUS达到高成功率所需训练速度比此前方法快4至6倍。真实机器人实验只有两项桌面任务、五个相机位置,每个位置各10次,结论边界较清楚。

两张RGB图先变成3D点云

ARGUS接收两个任意机位的RGB画面,用大规模3D视觉模型估计场景点云。点云经过尺度校准和世界坐标对齐后,从预先选定的标准视角重新渲染为2D图像,原有Diffusion Policy等策略直接读取这张图。

ARGUS处理流程

论文图1:两路RGB图像先重建并对齐3D场景,再渲染标准视角供动作策略使用。

它没有要求下游策略自己学会所有相机变化,也不需要为每个新机位重新收集同构数据。预处理把复杂的视角差异压到统一观察空间,策略把容量留给物体关系和动作。

多样机位不再全压给策略记忆

研究设置包含固定多相机配置和高度变化的相机位置,用来比较有限视角与多视角训练。原始画面里,同一只杯子会因相机高度、距离和朝向落在完全不同的像素区域。

训练数据中的多样相机位置

论文图2:训练数据覆盖不同高度、方位和距离的相机姿态。

ARGUS选择能看清工作区与操作物体的标准机位。所有输入都被投到这个视角后,策略面对的视觉分布更集中,因此更快收敛。

标准视角选择

论文图3:标准视角以工作区和被操作物体的可见性为选择依据。

点云错误会成为新的单点故障

如果两张图遮挡严重、3D模型深度估计错误或尺度对齐不准,重新渲染的画面会把几何误差直接交给控制策略。快速移动物体、透明容器和强反光表面都可能增加难度。

真实测试中,“马克笔放入杯子”和“展开毛巾”覆盖了刚体与柔性物体,但范围仍小。4至6倍是收敛效率,不是执行速度或成功率统一提升倍数。扩大到移动机器人、动态场景和更多任务后,标准视角预处理是否仍稳定,需要更大规模实机数据。

参考资料

https://arxiv.org/abs/2608.05579

https://rsathua.github.io/ARGUS/