arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

小米机器人学会先掂量再抓,陌生物体成功率达到83.4%

作者:arXivDaily编辑部 arXiv 2608.21355 cs · cs.RO

同样是纸杯,空杯需要轻捏,装满后又要增加抓力;外观相近的易拉罐,也可能因为重量不同而滑落。小米机器人团队提出ViTacPhys,让机械手在抓取时显式判断物体的质量等级、刚度和接触摩擦等级,再据此调整动作。真实抓取中,它在训练分布内物体上的总成功率为95.0%,在分布外物体上达到83.4%。

这项工作没有把“大模型看图猜材质”当作最终答案。系统同步读取腕部相机、三根手指的压力阵列和动作变化,把视觉先验与接触后的触觉证据合并。论文将它定位为一项系统可行性研究,实验对象共60件,参与采集人类演示的人员只有一名。

先用人手采集1800段视觉触觉演示

团队给人手戴上腕部相机、指尖压力阵列和动作捕捉标记。60件日常物体被分成七类,既有杯子、瓶子和罐子,也有容易变形的软质物体。每件物体按垂直拿起和横向摇动两种协议各采集15次,合计得到1800段演示,每段截取一秒、30帧的同步视觉触觉序列。

论文Figure 2:腕部相机、指尖压力阵列与动作捕捉共同记录人类抓取。

质量用0.1克精度的秤重复测量五次;刚度来自稳定挤压区间的力与位移拟合;摩擦系数则由物体在硅胶斜面开始滑动时的角度计算。作者明确指出,这里的刚度包含物体、手部、传感器安装和接触面的共同影响,摩擦系数也是物体与硅胶接触对的属性,不能当作材料的绝对常数。

视觉给先验,触觉负责纠正外观错觉

模型把RGB画面和触觉图都拆成内容流与运动流,通过双向交叉注意力对齐两种信号。接触前的五帧画面还会交给视觉语言模型,生成对类别、材质、纹理、形状和填充状态的文字先验;接触后的30帧队列再提供真实压力与运动变化。

论文Figure 4:视觉、触觉、运动和文字先验融合后,分别预测质量、刚度与摩擦。

在已见物体上,质量分类准确率为97.2%,摩擦等级准确率98.8%,刚度平均绝对百分比误差5.51%。对来自已知类别但未参与训练的物体,三项结果分别为87.5%、97.5%和9.08%。这些数字来自时间窗口级测试,不等于面对任意家庭物品都能保持同样精度。

把物理属性送进抓取策略

从人手迁移到机器人时,团队加入少量遥操作数据、与机器人动作匹配的人类演示,以及把人手画面处理成机器人视角的增强数据。预测出的物理属性被转成条件,送入ACT式动作策略。机器人遇到看起来相似、实际轻重或软硬不同的物体时,可以选择不同的抓力和运动轨迹。

论文真实机器人实验:ViTacPhys在ID与OOD物体上的干净成功、形变成功和失败占比。

分布内实验中,干净抓取成功率比ACT高12.5个百分点;分布外提升38.9个百分点。按总成功统计,ViTacPhys为95.0%和83.4%。论文还比较了两种方法都成功抓住的共同OOD物体,ViTacPhys的用力曲线更接近人类遥操作,但这一分析排除了只有单方成功的样本。

下一步是更丰富的手和更快的先验

项目页展示的灵巧手遥操作平台,用于把人类抓取知识迁移到机器人。

当前系统的触觉阵列主要测量法向压力,对精确质量和摩擦回归的约束有限;语义先验还依赖接触前的外部视觉语言模型。作者计划加入更丰富的力传感器、更多参与者和物体,扩大OOD测试,并压缩语义先验的计算延迟。若这些环节能在不同机械手和更杂乱环境中复现,显式物理属性可以继续用于物流分拣和家庭整理等需要控制抓力的任务。

论文还提示,质量与摩擦被离散成低、中、高三档,是因为现有压力阵列难以稳定约束连续数值。落地时需要根据任务重新校准分档边界,不能直接把实验室标签照搬到另一种指尖材料或夹爪结构。

参考资料

https://arxiv.org/abs/2608.21355

https://arxiv.org/html/2608.21355

https://vitacphys.github.io/ViTacPhys/