没有机械臂和夹爪,四足机器人也能用肩部、机身或腿接触椅子,把它推到指定位置。比萨大学、苏黎世联邦理工学院、英伟达等机构提出接触引导的多评论家强化学习方法,覆盖推箱、搬椅和开洗碗机三类非抓取移动操作任务。
实机验证集中在四足平台搬椅,推箱和开洗碗机主要在仿真中评估。论文展示的是受控环境下从仿真迁移到真实机器人的能力,尚未证明方法能在家庭杂物、未知家具和人员走动的场景中长期自主运行。
先找到能碰的位置,再学习怎么发力
传统移动操作通常假设机器人有机械臂,先抓住物体再移动。大型箱子、椅子或柜门未必适合抓取,四足平台反而可以利用身体接触完成推、拨、拖等动作。难点是接触空间巨大:从哪个方向靠近、身体哪一部分碰、接触后如何继续迈步,都会改变结果。
方法先根据物体几何生成候选接触点,再把可达性、运动目标和碰撞关系加入观察。候选点不是固定动作脚本,只给强化学习策略提供一组有意义的探索入口,减少机器人在空中乱走或以危险角度撞击物体。
图1:系统从物体几何生成候选接触点,并把接触、移动和任务目标交给策略联合优化。
多个评论家拆开稀疏奖励
把椅子从起点移到目标位置,最终奖励很稀疏。机器人可能已经走到正确一侧,却因为还没接触物体拿不到反馈;也可能把物体推动了一段距离,但自身姿态不稳定。单个价值网络要同时判断移动、接触和物体进度,训练容易被某一项信号主导。
研究团队使用多个评论家分别估计接近接触点、建立有效接触、推动物体和保持运动稳定的价值,再在策略更新时组合。训练还加入课程:先在较简单几何和短距离上学习,再逐步扩大目标范围、扰动和物体差异。
图2:红色标记是从椅子几何表面筛出的候选接触区域,策略仍需选择实际接触位置。
身体接触会形成连续动作序列
搬椅时,策略并非只冲撞一次。机器人先绕到合适方向,用机身侧面或肩部建立接触,再一边调整步态一边改变椅子朝向,最后把椅子送进目标圆区。对不同椅型,接触部位和绕行路线会变化。
图3:机器人先定向接近,再维持身体接触,将椅子沿目标方向持续移动。
实机实验使用两种椅子,并加入载荷变化、外力扰动和目标位置变化。论文报告策略能从仿真零样本迁移到真机完成搬椅,但样本量仍有限。地面摩擦、椅脚形状和机器人护壳材料都会影响接触动力学,换场地后需要重新测试。
下一步:先把接触变成安全能力
洗碗机任务要求先接触门板或把手区域,再随着门的转动调整身体位置。策略在仿真中形成多阶段接触:初次推动建立开门角度,随后换位置继续施力。研究者没有为每一阶段手写状态机,接触顺序由训练过程产生。
图4:洗碗机门转动后,策略重新选择接触位置并继续推动。
下一步需要把接触力限制、人体避让和物体损伤检测放进策略,使机器人知道“能推动”与“可以安全推动”的区别。若实机能扩展到更多材质和家具,非抓取移动操作可以让巡检、仓储和家庭四足机器人处理超出夹爪尺寸的物体,不必先加装一整套机械臂。
评测也应报告失败后的恢复动作,例如椅子卡住、机器人失去接触或目标区被占用时是否会停止并重新规划。对家庭和仓储场景而言,可预测的停止边界与峰值接触力,和任务成功率同样重要。
不同地板与家具材质的测试结果应分别公开,不能只汇总成功率。
参考资料
https://arxiv.org/abs/2608.28140
https://arxiv.org/html/2608.28140