arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙大让机器人少想多做:只在关键节点推理,也能守住长流程意图

作者:arXivDaily编辑部 arXiv 2609.02653 cs · cs.RO

论文导读

浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等机构联合提出HINT,让机器人只在操作阶段切换时重新理解指令,随后用多视角定位和跟踪维持目标。框架在3项长流程任务、2种基础策略及多类未见变化中提高任务进展和端到端成功率;证据仍来自指定分拣、拼字和插孔实验。

长指令执行久了,视觉捷径会带偏目标

“把红色水果放入对应盒子,再拼出指定单词”包含多次抓取、移动和放置。语言目标只在少数节点变化,摄像头画面却每一帧都在变。视觉语言动作模型若持续被当前显眼物体牵引,可能抓起最近的积木,而不是指令要求的那一块。

HINT借鉴人的操作节奏:只有从自由移动进入接触、从运输切换到下一个目标等阶段边界,才调用语义推理确定当前子任务和对象。阶段内不反复解释整条指令,而是持续跟踪已经确认的目标。

图:项目主视觉对比人在关键节点判断目标与HINT的稀疏推理、连续跟踪流程。

路由视角、锁定对象,再把位置交给动作策略

模式路由器先判断机器人正处于哪种操作阶段,并选择更有用的相机视角。到达语义更新点后,任务管理器解析当前目标,定位模块在画面中圈出对象,跟踪器在之后的连续动作里维持同一目标。

系统提供两种接口:一种直接在输入图像上高亮目标区域,另一种把目标位置变成注意力偏置。两者都不向基础动作模型增加额外可训练参数,因此可以接到不同策略上比较。

图:论文图2展示模式路由、语义定位与跟踪,以及向动作策略注入意图的位置。

三项任务检验长流程和未见组合

实验包括水果蔬菜分拣、积木拼字和插孔。前两项由多次抓放组成,插孔还包含接触丰富的精细对准。测试变化覆盖未见物体、颜色、布局、目标表达和指令组合,但使用的基础运动模式仍在训练范围内。

图:论文图4把三项任务拆成自由移动、接触前、运输和精细接触阶段。

论文报告HINT在两种基础策略上提高意图理解、任务进展和完整成功率,同时保持低延迟控制。消融图显示,去掉跟踪后任务时间和成功率会变化,说明只在节点推理的前提是阶段内目标跟踪足够稳定。

图:论文消融结果比较跟踪、不同视角和语义模块对时间与成功率的影响。

从桌面实验走向持续部署

下一步要处理任务中途临时改口、目标消失、抓取失败和人类插手等情况。此时系统不能机械坚持旧目标,需要判断何时提前触发一次新的语义更新,并记录触发原因。

部署评估还应统计错误目标被维持了多久。稀疏推理可以降低计算量,但一次错误锁定若持续几十步,代价会高于每步重新判断;把更新频率、控制延迟和错误恢复时间放在一起,才能找到不同机器人任务的合适节奏。

参考资料

https://arxiv.org/abs/2609.02653

https://robot-hint.github.io/