论文导读
香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配仍有差距。
一只手既要拿稳,还要完成对准和插合
常见机器人装配会让一只机械臂固定零件,另一只手负责旋转、对齐或插入;工厂里还可以用夹具代替“扶住”的动作。这篇论文把这些辅助全部拿掉:两个零件都在同一只灵巧手里,不同手指同时承担支撑、调整和施力。瓶盖要对准瓶口,注射器的推杆要插进针筒,马克笔帽也要在遮挡中找到正确方向。
图1:真机上的瓶子、注射器和马克笔三种单手双零件装配。
任务用两个零件之间的目标相对姿态来描述,而不是为每个物体单独写一套动作脚本。这样,同一套强化学习框架可以处理形状和接触方式不同的三个任务。奖励会鼓励手指按功能分工,同时让整体姿态不要偏离一张人类参考手势太远,避免策略在仿真里找到真机做不出的怪动作。
从一张人类手势出发,在仿真里练到能抗遮挡
团队没有收集大量真人操作轨迹,只用一张人类握持姿态来约束初始状态。仿真会围绕这张姿态随机生成物体位置、手指状态和扰动,让策略反复练习“先稳住、再对准、最后装上”。它同时读取一段历史本体感知信息和相机给出的物体状态,前者告诉系统手指刚刚怎么动,后者补充两个零件在哪里。
图2:论文从一张人类参考姿态出发,为瓶子任务生成多种仿真初始状态。
这个组合专门应对单手装配的难点:手指越靠近零件,遮挡越严重,相机的位置估计就越容易跳动。训练时加入物体位置误差、摩擦变化和外力干扰,策略学到的不是一条固定轨迹,而是在每一步根据当前状态继续修正。三个策略都完全在仿真中训练,真机阶段不再追加示范或微调。
真机能完成三类装配,但还不是任意零件通吃
真机实验使用单台相机估计物体姿态。论文展示了三类任务的完整装配,并测试了手部倾斜、零件位置误差和受控遮挡。连续画面里,手腕姿态被改变后,手指仍会重新调整接触点,把两个部件推向目标相对位置。
图3:施加手部倾斜干扰后,策略继续调整手指并完成装配。
这里的“零样本迁移”只表示仿真训练后的策略直接用于这套硬件,并不代表拿来任意新物体就能装。实验限定在三组刚性零件、已知目标姿态和受控桌面条件下。论文还发现,不同灵巧手的指长、关节范围和掌内空间会显著影响能否完成动作,因此单手装配也可以反过来检验机器人手的机械设计。
下一步是把单项策略带进真实装配流程
这套框架已经证明,同一只手可以同时固定和装配两个部件,减少对第二机械臂与专用夹具的依赖。要进入更接近生产的场景,后续还需要处理可变形零件、更松散的初始摆放、更多尺寸和材质,以及相机暂时完全看不到关键接触面的情况。若感知和机械结构继续改进,单手装配可用于狭小空间维修、移动机器人随手操作,以及工位无法容纳双臂协作的任务。
参考资料
https://arxiv.org/abs/2609.10137