中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。
机器人并非看完一次视频就直接掌握动态动作。方法先重建物体和目标,把静态轨迹拆成关键阶段,再通过改变速度、起始位置和运动方式合成大量演示,用扩充后的数据训练策略。
论文图1:单次真实静态示范经过增强后,覆盖传送带抓取等动态场景。
静态轨迹先被拆成任务阶段
流水线定位操作物体和目标区域,使用RGB-D信息重建几何,再从动作中提取接近、抓取、搬运和放置等关键帧。研究人员可以改变对象运动轨迹和阶段时序,生成原示范中没有出现的动态组合。
论文图2:物体定位、几何重建和动作关键帧共同决定合成轨迹。
这种方式减少了逐场景遥操作采集,但合成过程依赖物体重建与轨迹规则。遇到软体、透明物体或复杂接触,几何与动作标签更容易出错。
推理频率跟着动作阶段变化
动态任务中,机器人靠近移动目标时需要快速更新动作;完成抓取后,频繁查询大模型可能只增加延迟。DynamicManip训练一个阶段预测分支,根据当前任务阶段调整策略推理频率。
系统在变化快的阶段提高查询频率,在相对稳定阶段减少查询。平均策略查询延迟因此降低32.9%,同时保留对移动目标的响应速度。
论文图4:基准改变物体、运动轨迹和操作方式,测试策略对动态条件的泛化。
真机测试包含抓取、敲击、装载和接瓶
论文在仿真与真实机器人上评测。真机任务包括传送带抓取、动态敲击、移动平台装载和接住瓶子,目标速度与出现位置会变化。DynamicManip在这些受控任务中的平均成功率比对照高18.4个百分点。
论文图7:从上到下为传送带抓取、动态敲击、装载和接瓶。
单次静态示范是数据增强的起点,不代表不需要训练,也不代表任意新任务都能一示范完成。实验对象、速度范围、相机和机械臂配置均由团队设定。走出论文环境后,遮挡、碰撞、轨迹突变和安全约束还需要单独验证。
参考资料
https://arxiv.org/abs/2608.01452