arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

星尘智能&清华等提出ART:机器人现场调用视觉工具,成功率提升20%

arXiv 2608.14047 cs.AI · cs.CV · cs.RO

机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在复杂操作中比主流基线取得高20%的成功率。

传统VLA模型把相机画面、语言指令和机器人动作放进一条端到端网络。它简洁,却很难覆盖所有视觉条件:光线突然变暗、目标与背景颜色接近、容器边缘需要毫米级判断时,通用表征可能没有足够信息。ART将“选什么工具、怎样解释结果、下一步怎么动”统一进机器人的行动序列,使感知增强成为策略的一部分。

机器人可以在任务中途主动补充视觉证据

ART把外部视觉能力视为可调用动作。策略观察当前画面和指令后,可以直接输出机械臂控制,也可以请求深度估计、目标分割或其他专家模块;工具返回的结构化结果再次进入上下文,模型据此决定后续动作。它不要求每一帧都运行全部工具,因而将额外计算集中在真正困难的时刻。

ART与普通端到端策略在视觉工具使用方式上的对比

ART与普通端到端策略在视觉工具使用方式上的对比。

这种设计类似人类操作:光线充足时凭肉眼拿起物体,看不清距离时再换一个角度或借助测量。工具调用并非固定流程,而是随场景变化。模型必须学会何时调用、该信哪一种结果,以及工具输出与原始图像冲突时如何继续执行。

3万条轨迹同时教会“使用工具”和“完成动作”

仅把工具接口交给机器人,并不会自然产生正确的调用习惯。团队构建约3万条工具增强轨迹,在演示中记录原始观察、工具请求、工具反馈与后续控制,让模型看到视觉困难如何触发额外感知,以及这些证据怎样改变机械臂轨迹。

ART数据收集流程将工具调用与机器人动作共同写入轨迹

ART数据收集流程将工具调用与机器人动作共同写入轨迹。

训练目标仍保持统一的序列预测,工具使用不需要另起一个手工规则系统。这样一来,策略既能复用通用VLA的动作先验,又能把分割掩码、深度图等专业输出转化为可执行决策。数据覆盖的不是单一物体,而是多种光照、遮挡和空间关系组合。

工具增强轨迹也为训练提供了更细的因果链。研究者可以看到策略在调用工具前缺少什么信息、工具返回后哪段动作发生改变,再针对调用过早、重复调用或忽略结果等行为补充样本。这比只保留任务最终成功或失败更利于定位问题。

黑暗抓取等困难场景中,成功率提高20%

实验把模型放进普通视觉容易失效的任务,包括暗光下识别和抓取、在相似背景中定位目标,以及需要更精确几何关系的放置。ART会在关键步骤调用工具,再根据增强后的观察修正动作。综合结果显示,它比主流基线的成功率高20%,说明外部工具不只是生成解释,而确实改变了任务完成结果。

ART在暗光和复杂桌面环境中调用工具完成操作

ART在暗光和复杂桌面环境中调用工具完成操作。

成功率提升来自论文规定的机器人、任务与工具集合,不能直接外推到任意开放环境;当工具自身判断错误时,策略也可能收到误导。论文的价值在于给出一套可训练、可扩展的接口,使研究者能够继续加入更可靠的感知模块,而不必重做整个动作模型。

ART架构统一编码原始画面、工具反馈和动作序列

ART架构统一编码原始画面、工具反馈和动作序列。

下一步扩展为机器人现场的通用工具箱

ART最直接的扩展,是加入姿态估计、触觉分析、物体检索和三维重建等能力,让机器人面对新任务时组合多个专家,而不是等待一个更大的端到端模型覆盖所有情况。工具结果还可以带上置信度,帮助策略在证据不足时主动复查。

面向仓储、家庭和柔性制造,工具调用日志也提供了更清晰的审计线索:系统为什么停下、调用了什么、依据什么调整动作,都可以回看。随着工具延迟降低、训练数据覆盖更多异常条件,这种“基础策略加现场专家”的路线有望让机器人更快适应真实世界的长尾视觉问题。

参考资料

https://arxiv.org/abs/2608.14047