机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在复杂操作中比主流基线取得高20%的成功率。
传统VLA模型把相机画面、语言指令和机器人动作放进一条端到端网络。它简洁,却很难覆盖所有视觉条件:光线突然变暗、目标与背景颜色接近、容器边缘需要毫米级判断时,通用表征可能没有足够信息。ART将“选什么工具、怎样解释结果、下一步怎么动”统一进机器人的行动序列,使感知增强成为策略的一部分。
机器人可以在任务中途主动补充视觉证据
ART把外部视觉能力视为可调用动作。策略观察当前画面和指令后,可以直接输出机械臂控制,也可以请求深度估计、目标分割或其他专家模块;工具返回的结构化结果再次进入上下文,模型据此决定后续动作。它不要求每一帧都运行全部工具,因而将额外计算集中在真正困难的时刻。
ART与普通端到端策略在视觉工具使用方式上的对比。
这种设计类似人类操作:光线充足时凭肉眼拿起物体,看不清距离时再换一个角度或借助测量。工具调用并非固定流程,而是随场景变化。模型必须学会何时调用、该信哪一种结果,以及工具输出与原始图像冲突时如何继续执行。
3万条轨迹同时教会“使用工具”和“完成动作”
仅把工具接口交给机器人,并不会自然产生正确的调用习惯。团队构建约3万条工具增强轨迹,在演示中记录原始观察、工具请求、工具反馈与后续控制,让模型看到视觉困难如何触发额外感知,以及这些证据怎样改变机械臂轨迹。
ART数据收集流程将工具调用与机器人动作共同写入轨迹。
训练目标仍保持统一的序列预测,工具使用不需要另起一个手工规则系统。这样一来,策略既能复用通用VLA的动作先验,又能把分割掩码、深度图等专业输出转化为可执行决策。数据覆盖的不是单一物体,而是多种光照、遮挡和空间关系组合。
工具增强轨迹也为训练提供了更细的因果链。研究者可以看到策略在调用工具前缺少什么信息、工具返回后哪段动作发生改变,再针对调用过早、重复调用或忽略结果等行为补充样本。这比只保留任务最终成功或失败更利于定位问题。
黑暗抓取等困难场景中,成功率提高20%
实验把模型放进普通视觉容易失效的任务,包括暗光下识别和抓取、在相似背景中定位目标,以及需要更精确几何关系的放置。ART会在关键步骤调用工具,再根据增强后的观察修正动作。综合结果显示,它比主流基线的成功率高20%,说明外部工具不只是生成解释,而确实改变了任务完成结果。
ART在暗光和复杂桌面环境中调用工具完成操作。
成功率提升来自论文规定的机器人、任务与工具集合,不能直接外推到任意开放环境;当工具自身判断错误时,策略也可能收到误导。论文的价值在于给出一套可训练、可扩展的接口,使研究者能够继续加入更可靠的感知模块,而不必重做整个动作模型。
ART架构统一编码原始画面、工具反馈和动作序列。
下一步扩展为机器人现场的通用工具箱
ART最直接的扩展,是加入姿态估计、触觉分析、物体检索和三维重建等能力,让机器人面对新任务时组合多个专家,而不是等待一个更大的端到端模型覆盖所有情况。工具结果还可以带上置信度,帮助策略在证据不足时主动复查。
面向仓储、家庭和柔性制造,工具调用日志也提供了更清晰的审计线索:系统为什么停下、调用了什么、依据什么调整动作,都可以回看。随着工具延迟降低、训练数据覆盖更多异常条件,这种“基础策略加现场专家”的路线有望让机器人更快适应真实世界的长尾视觉问题。