arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里浙大等提出PassGen:先生成带深度的递物视频,让机器人更早伸手接东西

arXiv 2608.13028 cs.CV · cs.RO

人拿起杯子可能是自己喝,也可能准备递给机器人。若等物体已经伸到面前才判断,机械臂反应会显得迟钝;过早误判又可能突然伸手。阿里巴巴、浙江大学等团队提出PassGen,先生成未来的RGB-D递物视频来判断意图,并利用Hand2Bot真实数据中的深度噪声训练,最终零样本迁移到实体机器人。

人机交接需要同时回答两个问题:对方是不是要递东西,以及物体将在哪里、以什么姿态到达。只做二分类会丢掉空间信息,只预测抓取点又可能忽视动作语境。PassGen把意图理解和未来几何放进同一段生成过程。

Hand2Bot把真实传感器噪声也留在数据里

团队构建Hand2Bot RGB-D人机递物数据集,同时记录彩色视频和深度。深度图提供手、物体与机器人之间的距离关系,却会受到反光、遮挡和传感器空洞影响。研究没有把这些噪声全部清洗掉,而是让模型面对部署时真实会出现的输入分布。

Hand2Bot记录的人类递物动作、深度与机器人接取过程

Hand2Bot记录的人类递物动作、深度与机器人接取过程。

数据包含不同物体、动作阶段和是否递交的情形。模型因此需要区分“拿着物体经过”“调整握姿”与“明确伸向机器人”,不能只靠物体越来越大或手臂向前这一种捷径。RGB负责外观和语境,深度负责几何,两种信息共同决定触发时机。

生成未来视频,用动作演化而非单帧猜意图

PassGen建立在稳定视频扩散模型上,加入意图感知的时间特征编码器。系统观察当前片段后生成接下来可能发生的RGB-D序列:如果是递交,未来帧会呈现物体朝机器人接取区域移动;若不是,轨迹与姿态演化会显示另一种趋势。

PassGen从当前RGB-D观察生成未来递物视频的整体流程

PassGen从当前RGB-D观察生成未来递物视频的整体流程。

生成式建模的好处是保留多种可能未来。机器人不仅得到一个“是或否”,还能查看手和物体的时空变化,据此提前规划末端执行器。模型生成的深度还提供抓取位置线索,让意图识别与运动准备共享预测结果。

专门编辑深度噪声,仿真训练后直接上实机

合成或理想深度往往边缘干净,而真实相机在手指、透明杯和反光表面附近会出现缺失。PassGen设计形态相关的深度噪声编辑,使训练样本更接近真实传感器。零样本迁移时无需用目标机器人重新微调,也能保持较高意图准确率与较低误触发,并比只看当前帧的方法更早预判递交。

PassGen对不同机器人形态与传感器深度噪声进行适配

PassGen对不同机器人形态与传感器深度噪声进行适配。

机器人根据PassGen预测的手和物体轨迹提前执行抓取

机器人根据PassGen预测的手和物体轨迹提前执行抓取。

论文摘要没有给出可跨设置概括的单一成功率数字,具体效果需结合物体、机器人与阈值阅读。零样本也指论文实验中的训练—测试设定,并非对任意机械臂、任意相机都无需标定。它证明的是:把真实深度噪声和形态差异提前写入生成模型,可以显著缩短从数据集到实机的距离。

下一步走向更自然的协作与主动接取

PassGen适合仓储、家庭与服务机器人中的递物动作。机器人可在确认意图后提前移动到安全等待位,再根据未来深度轨迹微调抓取,而不是最后一刻突然加速。生成的多帧预测也能交给安全模块检查:只有连续多步都指向交接区域时才真正伸手。

未来可以加入目光、语音和身体姿态,把“给你”“帮我拿着”等信号与RGB-D运动联合起来;也能扩展到双向交接、多人场景和移动底盘。若再用不确定性决定何时追问或暂停,机器人会更像合作者而非自动夹爪。Hand2Bot与PassGen提供了从感知、预测到实机动作的完整起点,让提前理解人类意图成为可测量的机器人能力。

产品化时还可把“更早”拆成可调参数:养老陪护更重视平稳和低误触发,流水线协作可能更看重节拍。系统根据用户距离、物体重量和历史交接习惯调整触发阈值,并记录每次预测与实际交接的偏差。持续校准后,同一套生成模型就能适应不同人的递物速度和不同机器人的运动能力。

参考资料

https://arxiv.org/abs/2608.13028