arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达ADEPT训练灵巧手:五次实验全部闯到最高难度

arXiv 2608.19182 cs · cs.AI · cs.RO

五指机械手要完成插销,得先找到物体、抓稳、在手中调整方向,再把它对准孔位。英伟达、密歇根大学提出ADEPT:先用通用“物体重定向”任务预训练,再用一套稳定后训练方案学习具体操作。论文的Kuka-Allegro插销实验中,五个随机种子全部训练到最终难度,平均用时19.9小时。

团队把教师策略蒸馏到直接读取视觉与触觉的学生策略,在23自由度Kuka-Allegro和29自由度Flexiv-Sharpa两套硬件上做了从仿真到现实的零样本迁移。这里的“零样本”指不使用真实世界训练数据完成迁移,并不表示新任务完全无需仿真训练。

先把抓、转、托这些动作练成通用底座

ADEPT的预训练任务不是插销或摆盘,而是在手中把不同物体转到目标姿态。训练对象包括16种基础几何体,策略学习手指如何接触、换指、托住和重新抓取。这个任务足够通用:插销、盘子等下游操作都需要先把物体摆到合适方向。

两种灵巧手完成长程操作

论文Figure 1:Kuka-Allegro摆盘与Flexiv-Sharpa插销都包含抓取、转向、运输、对齐和插入。

预训练教师面对未见过的物体仍保持较高成功率。Kuka-Allegro在16种基础物体上的成功率为0.73,在152个VisDex物体上为0.77;Flexiv-Sharpa对应结果为0.64和0.61。数字来自仿真中的重定向任务,说明动作底座没有只记住训练形状。

直接做强化学习微调,原有能力会迅速归零

把预训练策略直接交给PPO学习插销,效果并不好。论文在ADR难度20处观察到,朴素微调的成功率在少量更新内跌到零。原因是旧价值网络估计的是重定向奖励,换成插销奖励后,错误优势值会把动作策略迅速推离已经学会的分布。

ADEPT用三步处理这个断层:先以行为克隆保留预训练动作,再单独预热新的价值网络,最后用更小学习率和更保守的裁剪范围进行在线更新。完整配置的五次独立实验都达到ADR 50,训练成功率为46.0%±1.1%;从零训练的多数种子则长期停在ADR 6以下。

从零训练、预训练和ADEPT抓法对比

论文Figure 12:从零训练、直接使用预训练策略与ADEPT后训练产生不同抓法,右下为ADEPT形成的包络式抓取。

预训练总计使用80亿环境步,插销后训练再用30亿步。80亿步并没有消失,而是可以由多个下游任务分摊;对新增任务,边际训练量是后面的30亿步。

两套实机读到的传感器并不相同

Kuka-Allegro使用两个RGB相机,Flexiv-Sharpa除两个RGB相机外还有五个指尖视觉触觉传感器。教师在仿真中读取完整状态,学生通过蒸馏只读取部署时可用的视觉、触觉和本体感知。关节空间Geometric Fabric位于策略和硬件之间,用来限制不安全的关节动作。

ADEPT真实硬件与测试物体

论文Figure 4:两套机械臂—灵巧手平台、相机位置、插销和餐盘,以及实机测试采用的初始状态与光照。

实机展示覆盖盘子翻转、运输、插入架子,以及插销抓取、手内重定向、对齐和插入。论文称动作速度达到人类水平,但并未给出面向生产线的节拍、连续运行时长或故障率,因此它仍是研究系统的操作验证。

从单个下游任务走向可复用技能库

插销任务从抓取到插入

论文Figure 7:仿真中的插销任务逐步提高目标难度,最终要求把插销对准并插入孔位。

ADEPT下一步适合检验同一预训练底座能否连续支持装配、理线、工具使用等更多任务,并统计每增加一个任务需要多少仿真步。实机部署还要报告不同物体材质、相机偏移和触觉传感器磨损下的成功率。

论文当前只在两套手臂—灵巧手组合上展示迁移,因此“通用”仍指任务间复用训练底座,不等于无需重新蒸馏就能跨任意硬件直接部署。

论文已经给出一个明确结果:对高自由度灵巧手,保住已有动作知识比直接微调更重要。可复用程度最终要由更多下游任务和更长时间的实机运行来证明。

参考资料

https://arxiv.org/abs/2608.19182

https://adept-dexterity.github.io/