arXivDaily arXiv每日学术速递 周一至周五更新
海上生明月,天涯共此时!祝大家学得开心,也要注意身体~~

PAPERDAILY REPORTS

机器人不会再求助,斯坦福把人工示范效率提2.9倍

作者:arXivDaily编辑部 arXiv 2609.28314 cs · cs.RO

论文导读

斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。

遥操员为什么总在重复机器人会的动作

收集长时序机器人示范时,人类操作员往往得从头到尾完成整个任务。但其中的抓取、搬运、放置等步骤,现有任务与运动规划已经能够自动完成。人类时间被消耗在机器人已经会做的部分,真正缺失的动作反而只占一段。

TANDEM把人类帮助定义为一种“按需规划能力”。系统先检查当前规划域能否表达任务所需状态和动作。如果发现缺少“盒子已打开”这个状态,视觉语言模型会增加缺失谓词,再把“揭开盒子”交给人执行。

图:Figure 2中,系统识别出开盒能力缺口,将人工遥操步骤插入自主抓放计划。

人做完一段,机器人要先验收

人工阶段结束后,TANDEM不会默认动作已成功。它重新观察场景,检查预期效果是否成立,再让自动规划继续执行。这一步很关键:如果人打开盒子后位置发生了变化,后续抓取必须基于新画面重新定位,不能照旧计划盲执行。

五项评测任务包含处理面包卷、解约束谜题、搬运零食、重构书本和把面包放进关闭的盒子。每个任务都混合了规划器能做的抓放步骤和域外操作。

图:Figure 3用连续帧标出五项任务中的自主TAMP阶段与人工遥操阶段。

未来落地:20条示范后,平均成功率从0%到60%

团队还用示例预训练轨迹,让规划器生成的运动更接近目标VLA模型原本见过的数据分布。每项任务只用20条TANDEM示范微调π₀.₅-DROID后,五项任务的平均成功率从0%升至60%。在一项代表性长任务上,相同人工介入时间获得的示范数是全程遥操的2.9倍。

图:Figure 6对比预训练策略、HITL-TAMP与TANDEM微调后在五项任务上的平均成功率和任务进度。

2.9倍来自一项代表性任务,60%也是这五项受控任务的平均值。下一步若要用到更大规模的机器人数据采集,需要检查视觉语言模型对能力缺口的识别是否可靠,以及人工阶段失败时能否安全回退。

它更像一种人机协作的数据生产协议,而不是完全取消人工。人的时间被集中到开盒、解约束等机器人真正不会的片段,规划器则承担其余可自动完成的步骤。实际部署还要记录每次介入的触发依据、验收结果与回退路径,否则错误的能力判断可能把危险步骤留给机器人,或者反过来频繁打断操作者。论文尚未覆盖开放工厂中的长期运行成本,这也是2.9倍效率能否外推的关键。

参考资料

https://arxiv.org/abs/2609.28314

https://prpl-group.com/tandem/

↑