arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机器人思考从10步砸到2步,推理时间61.557ms降到21.956ms

作者:arXivDaily编辑部 arXiv 2609.39822 cs · cs.RO

论文导读

Magiclab Robotics、浙江大学与东南大学研究视觉—语言—动作模型的实时执行,把10步去噪压到非均匀两步,并搭建端到端诊断框架。论文报告模型推理由61.557毫秒降至21.956毫秒,但同时强调通信、调度、平滑与机械响应也会决定真机效果。

快模型不一定带来快机器人

机器人循环包含相机采集、网络传输、模型推理、动作缓冲、控制器执行与日志记录。只测GPU前向时间,会漏掉等待新观测、动作过期和机械臂跟不上等问题。团队把这些环节放入统一服务框架,以同一平台记录请求时刻、返回时刻、执行轨迹和关节状态,让不同实时策略可以按整条链路比较。

图:系统图从客户端、推理服务、动作缓冲一直连接到机器人控制器和运行日志。

两步去噪不是平均砍掉八步

扩散式动作模型通常多次去噪。论文发现,早期阶段负责形成大致动作,末段负责短时修正,于是采用非均匀两阶段:第一步做较长跨度的粗预测,第二步在接近执行端的位置集中纠偏。相较机械地取两个等距时间点,这种安排保留了末段精细控制,并能与训练时实时校正结合。

图:两阶段架构先完成长跨度预测,再在短时间范围内精修动作,避免平均分配计算。

61.557到21.956毫秒只是链路的一段

论文报告,模型推理时间由10步设置的61.557毫秒降至两步设置的21.956毫秒,并在双臂叠衣等长时任务中比较六类执行方法。结果也显示,异步执行可能制造动作断层,平滑策略可能降低抖动却增加滞后。单一延迟数字不能代替任务成功率、轨迹连续性与峰值加速度。

图:运行时曲线同时检查关节位置、速度和加速度,用来发现肉眼不易察觉的动作不连续。

未来落地需要软硬件共同验收

后续落地应给出从光子进入相机到关节开始响应的端到端延迟,并分场景报告最坏值而非只有平均值。还要在网络抖动、丢帧和机械负载变化时复测。两步去噪解决的是关键计算瓶颈,真正可靠的实时机器人仍需要调度、控制与安全停机机制共同完成。

部署时可把时间预算拆成感知、排队、推理、传输、缓冲和机械响应六段,并为每段设置超时策略。某次请求若超过有效窗口,系统应丢弃过期动作而不是继续执行;连续超时时则进入安全姿态。长任务还要比较平均成功率之外的动作平滑度、峰值加速度与人工接管次数。只有当两步模型在计算更快的同时没有增加突跳和累积误差,21.956毫秒的优势才会转化为真实生产节拍,而不是停留在GPU计时器上。

尤其在双臂协作里,两侧时钟与控制频率也必须同步记录,否则单臂延迟下降仍可能造成配合失败。

参考资料

https://arxiv.org/abs/2609.39822

https://embodied.magiclab.top/works/inference/

↑