华盛顿大学、微软研究院和MIT的研究团队提出了ARCHITECT,把机器人策略获取当成一个交互式程序合成任务:LLM编码智能体合成模块化的机器人程序,调用一套感知与控制工具来操作真实机械臂。在Franka Panda机器人上的8个真机任务、6类挑战中,ARCHITECT在没有使用任何机器人专项训练数据的情况下,成绩超过了VLA模型π0、π0.5和程序合成基线Code as Policies,尤以多步推理任务差距最大。
端到端策略败在不可调试
视觉-语言-动作模型的零样本操作能力已经很像样,但它们是黑箱策略:失败了无法解释、难以修正,分布一偏就出现不可预测的级联失效。现场工程师没法打开π0看看哪一步出了问题,只能换指令重试。
ARCHITECT换了条路:策略不是神经网络权重,是一段人类可读的程序。模块化的结构允许用户把失败隔离到具体模块,把反馈定位在需要的抽象层级上。人用自然语言纠正,纠正通过程序执行轨迹落到具体代码,再蒸馏进一个持久的技能库——一种长期上下文学习,智能体据此积累可复用、可解释的行为。
图:ARCHITECT系统总览。LLM编码智能体合成模块化程序,调用感知与控制工具,人类以自然语言纠正并沉淀进技能库(论文Figure 1)。
8个真机任务横评
评估在真实Franka Panda机械臂上完成,8个任务覆盖6类挑战:拣放之外,还有需要多步推理的组合任务。对比对象是Code as Policies、Physical Intelligence的π0和π0.5,以及消融版本ARCHITECT-VLM。附录里还加了MolmoAct2、GR00T N1.7等VLA和Inner Monologue、ProgPrompt等LLM规划器的扩展对比。
结果的模式比名次更有信息量:拣放类任务大家都能做,差异出在多步推理任务上——π0和π0.5在这些类别外成功率很低,ARCHITECT保持稳定。MolmoAct2只在一个拣放任务上追平ARCHITECT,其余任务均未胜出。
图:真机评估的8个任务与6类挑战,全部在Franka Panda上执行(论文Figure 3)。
图:真机任务执行序列,机械臂在多步任务中指令为「把意面盒竖直放到架子上」(论文Figure 7)。
指令怎么说不重要,说什么才重要
VLA的另一个软肋是指令敏感。团队用表现最好的π0.5做指令扰动实验,从四个维度折腾同一条指令:改写措辞、增减长度、插入干扰项、改变明确程度。π0.5对任务欠明确、过明确和改写都敏感,成功率波动明显;ARCHITECT对这些变化保持稳定。
原因回到结构上:程序合成依赖的是指令的语义内容,代码里的每个模块对应明确的功能,措辞变化不影响模块选择;端到端策略则把整条指令映射成动作序列,指令表面的任何变化都可能扰动这个映射。
图:ARCHITECT与三类基线在泛化、自主性、适应性、任务多样性、信任效率和样本效率上的雷达对比(论文Figure 2)。
图:ARCHITECT(含GCR)与Code as Policies、π0、π0.5在同一长时程任务上的成功与失败帧对比(论文Figure 4)。
技能库复利与下一步部署
单次合成的优势有限,ARCHITECT的复利在技能库:一次纠正沉淀下来的技能,后续同类任务直接复用。论文测量了这种摊销效应——技能库让智能体在新领域任务上的表现持续改善,人类监督的投入随任务数摊薄。
部署门槛也需要交代:每次合成都要调用LLM编码智能体,执行依赖一套为机械臂准备的感知与控制工具,任务环境变化大时工具库本身要扩充。人类评估的另一组数据支撑了这个判断:技能库填充之后,人机循环试验需要的提问次数变少,成功率没有下降——技能库摊销的正是监督成本,而不是用质量换效率。对工业场景里任务结构相对固定、但指令表达多变的需求,这套「程序即策略」的路线给出了一条和端到端VLA完全不同的工程答案。