论文导读
动作扩散策略为机器人带来极佳的柔顺控制与多模态泛化,但其高昂计算开销难以满足双足人形机器人的机载实时性要求。哈尔滨工业大学联合上海创新研究院、清华大学与上海交通大学等机构研发了轻量化动作预测扩散架构PredActor。该策略在低算力机载芯片上实现了16.79毫秒超低控制延迟,助力宇树G1机器人在连续强推干扰下实现敏捷动态平衡。
核心背景与机载实时挑战
基于扩散模型的模仿学习在机械臂与具身移动操作中展现了非凡的表达能力,但将其部署到自持电力的全尺寸人形机器人上却长期面临算力鸿沟。双足平衡控制通常要求全身控制器维持至少50Hz甚至更高的执行频率,单步推理预算被死死卡在20毫秒以内。哈尔滨工业大学、上海创新研究院、清华大学与上海交通大学的研究团队联合提出了专为人形机载端优化的动作预测扩散策略PredActor。
传统的双足机器人控制方案往往依赖外部高性能工作站进行无线串流计算,不仅存在网络抖动丢包的安全风险,也极大限制了机器人的自主室外漫游半径。PredActor将未来的动作预测与即时的步态生成统一纳入单一网络,巧妙利用前序动作残差来减少去噪迭代次数,仅需2步采样即可输出高精度的关节位置指令。
图:动作预测与策略执行一体化的机载紧凑扩散控制流水线
端侧模型轻量化与推理加速
为了将庞大的扩散模型压缩至嵌入式计算平台,研究人员对去噪骨干网络实施了深度的端侧加速改造。算法通过重构多头注意力的键值矩阵打包方式,并对固定维度的任务指令编码建立本地缓存,显著减少了显存带宽的重复搬运。在仅功耗极低的Jetson Orin NX机载芯片上,PredActor的端到端单步推理耗时被成功压缩至16.79毫秒,完美越过双足闭环所需的实时红线。
图:在低算力机载芯片上各加速模块对整体运行耗时的削减效果
真实环境操作与动态抗扰实测
在宇树G1全尺寸人形机器人上的抗扰推搡实验中,PredActor展现出了惊人的敏捷反应与动态恢复韧性。当受到高达数百牛顿的突发横向冲撞推搡时,机器人能够在数十毫秒内自发进行侧向交叉步调节与躯干力矩补偿,有效抗推恢复率较传统控制器提升近一倍。
图:人形机器人在突发推力撞击干扰下的自适应抗扰与快速恢复序列
未来应用与落地展望
这一技术突破彻底解放了人形机器人对外部算力集群的束缚,让复杂动作扩散策略真正具备了全自主野外移动的工程实用价值。未来该技术将广泛推广至灾难救援、工业复杂巡检与户外野外作业等对动态抗扰和端侧独立性要求严苛的通用机器人场景。