arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机械手学会预判人类会喊停的动作,抓取成功率做到96.7%

作者:arXivDaily编辑部 arXiv 2609.06009 cs · cs.RO

论文导读

香港科技大学(广州)、意大利技术研究院、浙江大学联合提出WHIRL,让机械手把人类接管动作当成风险信号,提前避开操作者可能喊停的状态。16自由度LEAP Hand在指定复杂抓取任务中做到96.7%成功率,按操作步数计算的人工干预最多减少84%。结果来自论文规定的物体和任务,不代表机械手已经能判断所有现实风险。

人类接管的那一刻,本身就是训练数据

真实机械手用强化学习练抓取,代价远高于仿真。手指撞到桌面、物体滑落或关节姿态过激,都可能损坏硬件。人机协同训练允许操作者在危险发生前接管,但常见做法只把接管后的正确动作记下来,忽略了更有价值的信息:操作者为什么偏偏在这个状态出手。

WHIRL把每次接管压成一个二元标签,再学习“从当前状态继续执行,未来多大概率会触发人工干预”。机器人不必等到失败或被接管后才改动作,而是在选择动作时主动远离高干预概率区域。

图1:项目页总览展示人类输入、干预感知世界模型和机械手多步任务之间的关系。

四个预测头同时看结果和风险

系统内部是一个潜在世界模型。它根据当前观察和动作预测下一个内部状态,同时预测奖励、任务是否结束,以及未来是否可能触发人工干预。最后一个“干预概率头”把操作者的安全阈值变成可参与策略优化的风险分数。

训练早期仍由人类通过空间鼠标控制机械臂末端、数据手套控制LEAP Hand,脚踏板负责在自动执行和人工接管之间切换。模型从这些回放中学习基础动作与风险边界,随后用残差策略在已有行为基础上微调,避免从零开始在真机上盲目探索。

图2:项目页流程图展示行为先验、残差策略、人类回放与干预感知世界模型如何连接。

96.7%成功率与84%干预下降怎样理解

团队在16自由度LEAP Hand上测试规则物体和不规则物体抓取、抽屉等棱柱关节操作,以及多阶段长任务。复杂抓取的最高成功率达到96.7%;按每个执行步骤加权统计,操作者干预负担最多下降84%。这里的“负担”不是训练人数减少84%,而是同类实验中需要接管的操作步数明显变少。

图3:论文任务图包含积木抓取、抽屉操作及抓取—放置—关闭等长链条真机任务。

论文的关键对照是去掉世界模型或风险塑形后,策略更容易进入后来需要人类接管的状态。风险预测也不是碰撞传感器,它学习的是这批操作者在这些任务中的接管模式。换操作者、换机械手或换到更软、更易变形的物体,安全阈值都可能变化。

从实验室接管走向可复核的安全部署

下一步可以把干预概率与力觉、触觉、关节温度和碰撞检测一起使用,让风险判断不只依赖视觉和历史动作。另一个问题是不同操作者对危险的容忍度不同,需要记录谁在什么条件下接管,并检查模型是否把个人习惯误当成统一安全标准。对仓储分拣和精细装配而言,减少人工盯守有直接价值,但上线前仍要用独立安全机制兜底,不能让学习到的接管概率成为唯一保护层。

参考资料

https://arxiv.org/abs/2609.06009

https://arxiv.org/html/2609.06009

https://whirl-dexterous.github.io/