arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机器人不再走走停停:IMLE-VLA把动作推理从15Hz拉到55Hz

作者:arXivDaily编辑部 arXiv 2609.10915 cs · cs.CV · cs.RO

论文导读

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4项受控任务。

视觉模型想好了,动作头还在反复采样

视觉语言动作模型先理解相机画面和文字指令,再输出机械臂接下来的一段动作。很多系统用扩散或流匹配动作头,需要从噪声开始迭代10次。每轮都要前向计算,控制频率下降,机器人执行完一小段动作后只能等下一次结果,于是出现走走停停。

IMLE-VLA把动作头换成条件隐式最大似然生成器。训练时为同一个任务采样多个随机向量,选择最接近真实动作的结果更新。这样保留“一种状态可能有多种合理动作”的多样性,同时推理只需一次前向计算。

项目总览:单步动作头以一次前向计算替代流匹配的10次迭代,并显示55Hz与15Hz对比。

单步生成避免回归动作变成平均值

直接用回归预测动作虽然快,却容易把多个可行方向平均成一个不自然动作。比如机械臂绕过障碍可以从左或右走,平均后反而撞向中间。条件隐式最大似然训练会保留不同随机输入对应的多种动作,不要求把它们压成单一均值。

方法接在π0.5视觉语言骨干之后,不改视觉理解部分。动作块一次生成,控制器可以更快重新观察环境并纠正。论文测得推理频率3.67倍于原版,55Hz对15Hz;把执行跨度调到30步时,动作吞吐最高可达11倍。

项目图:IMLE-VLA一次前向生成动作块,基线需10次迭代。

98.0%成功率来自LIBERO,真机看平滑度和耗时

LIBERO包含40个任务。执行跨度为10时,IMLE-VLA平均成功率98.0%,原π0.5为97.5%;同时推理频率更高。跨度增加到30时,成功率降至97.1%,但动作吞吐达到11倍,显示速度与反应性需要取舍。

LIBERO-plus对背景、初始位置、语言和布局加入五级扰动。IMLE-VLA大致保留原骨干的鲁棒性,其他部分加速基线下降更明显。

项目图:不同方法在背景、机器人初始状态、语言和布局扰动下的成功率变化。

真机使用Franka Panda完成4项任务。论文报告动作抖动降低2.2至3.0倍,每回合VLA推理时间减少3.9至6.6倍,并在4项任务中都比π0.5更快。任务数量仍少,设备和场景也受控,不能外推到任意机械臂。

下一步要测更长任务和算力受限设备

单步动作头的价值在于不换大骨干就能消除推理瓶颈。后续可以在移动机器人、双臂和更长任务中检查错误是否会随动作块累积,并测量不同硬件上的端到端控制延迟。

部署时还要动态选择执行跨度:环境稳定时多走几步,接近障碍或人与机器人交互时缩短跨度。这样才能把55Hz的模型推理优势变成真实系统的安全反应速度。

参考资料

https://arxiv.org/abs/2609.10915

https://arxiv.org/html/2609.10915

https://kianhk6.github.io/IMLE-VLA/