arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

上交提出ReflexVLA:机器人学会预判运动轨迹,专攻6项高速动态任务

arXiv 2608.14379 cs.AI · cs.RO

静态桌面上慢慢抓取,模型多想半秒未必出事;面对滚动、摆动或即将离开的目标,等图像编码和动作生成完成,机会已经过去。上海交通大学团队提出ReflexVLA,把未来运动预测、多帧视觉融合和低延迟推理放进同一策略,并发布包含6类高速动态任务的ReflexBench,专门检验机器人能否“预判后出手”。

现有VLA模型通常在单张图像上做决策,默认环境在推理期间近似静止。现实系统却有相机采集、网络传输、视觉编码和机械臂执行等多段延迟。目标速度越快,模型看到的位置与机械臂真正抵达时的位置差得越远,静态任务上的高成功率无法说明动态反应能力。

ReflexBench把延迟与运动速度变成可控变量

ReflexBench设计6类动态任务,并提供同步与异步执行方式。研究者可以调节目标运动、感知延迟与控制节奏,观察同一策略在不同时间压力下的表现。基准既包含仿真,也覆盖真实机器人实验,任务关注追踪、拦截和动态操作,而不是把静态物体随机换位置。

ReflexBench覆盖多种需要快速反应的动态机器人任务

ReflexBench覆盖多种需要快速反应的动态机器人任务。

这种设置把“慢”造成的失败单独暴露出来:模型可能认对目标、也知道正确动作,却因为动作依据的是过时画面而失败。统一延迟配置还能比较算法优化与硬件优化分别贡献多少,避免只报告某一台设备上的最终成功率。

同步模式会等待一轮感知与控制完成,便于严格测量每个模块;异步模式则允许新图像不断进入,控制线程使用最近可用结果。两种协议共同覆盖实验室评测与真实部署,研究者可以判断提升来自预测能力,还是仅仅来自更激进的并行流水线。

不只看当前帧,而是预测机械臂到达时的世界

ReflexVLA融合连续多帧视觉,利用目标在时间上的位移判断运动趋势,并显式预测未来状态。策略生成动作时瞄准的不是相机刚刚看见的位置,而是考虑系统延迟后,物体可能出现的位置。这与人接球时盯住轨迹而非追逐上一帧位置相似。

ReflexVLA融合历史画面并预测未来状态的模型结构

ReflexVLA融合历史画面并预测未来状态的模型结构。

多帧信息也帮助模型区分外观相似但运动方向不同的场景。单帧只能看到物体“在哪里”,连续观察则能回答“正往哪里走、速度多快”。未来预测与动作头共同训练,使时间信息直接服务于控制,而不是额外输出一段仅用于展示的轨迹。

预测窗口还需要匹配端到端延迟。窗口太短,机械臂到达时目标已经越过预测点;太长则会放大运动突变带来的误差。ReflexVLA把时间偏移纳入训练与评测,使模型学习面向执行时刻的观察,而不是笼统追求越远越好的轨迹外推。

批量编码与CUDA Graphs压缩反应时间

有了预测仍不够,计算链路本身必须更快。ReflexVLA将多帧视觉批量编码,减少重复调用开销,并利用CUDA Graphs固定关键执行路径,降低内核启动与调度延迟。异步模式让感知和控制不必严格串行等待,使机械臂能够更连续地更新动作。

ReflexVLA在真实机器人上完成高速动态操作

ReflexVLA在真实机器人上完成高速动态操作。

团队在真实任务中验证了整套系统,并用延迟实验分析性能随时间开销的变化。结果适用于论文使用的机器人、相机与任务速度;面对更强遮挡或突然改变方向的目标,未来预测仍需要及时纠正。但基准让这类边界可以被量化,而不再只靠演示视频判断。

不同推理延迟下动态任务表现的变化

不同推理延迟下动态任务表现的变化。

下一步把快速反应带到移动机器人与人机协作

ReflexVLA可扩展到传送带分拣、移动抓取、体育机器人和人与机器人共同搬运。未来状态不仅包括物体轨迹,也可以加入人的动作意图与机械臂自身动力学,让策略提前避让或准备接触,而不是碰到变化后再紧急修正。

更完整的部署还需要将相机曝光、通信抖动和执行器响应纳入统一时间模型。若ReflexBench继续增加不同硬件和真实扰动,研究者就能针对“感知更准、预测更远还是控制更快”做可复现取舍,推动VLA从稳态操作走向真正的实时交互。

参考资料

https://arxiv.org/abs/2608.14379

https://reflexvla.github.io/