论文导读
字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。
从写软件代码,走到写机器人策略
编程智能体擅长读代码、调用工具、执行测试和根据结果修改方案。机器人任务也可以提供类似的闭环:智能体写控制程序,在仿真环境执行,看物体是否到位,再修正代码。但长时序操作比一次性抓取更难,任何一步的位姿误差都可能让后续十几步全部失败。
EMBODIEDSWE-BENCH收纳了接触密集操作、可变形物体和最长需半小时连续互动的任务。具体场景包含叠衣、用内六角扳手安装电脑、双臂组装桌子、装机器人零件、拧灯泡和搬运等多步任务。
图:Figure 1上部是长时序机器人任务,下部是编程智能体解决任务并把验证解法转成策略监督数据的流程。
前沿Agent能解难题,但解法太专用
实验显示,前沿编程智能体能解决多种复杂长时序任务,也能把已有解法迁移到其他任务或机器人形态。团队还提供了分阶段调试和可验证状态等工具,帮助Agent更快找到失败环节。
代价是大量迭代互动。智能体经常要多次执行、观察和改代码,才能得到可验证解法。更重要的是,写出来的方案通常只适用于当前物体位置、起始状态和任务实例,不能直接当作通用机器人策略。
图:Figure 2以连续帧展示叠衣、装机、双臂装配、工具收纳和搬运等编程智能体成功解法。
未来落地:一个验证解法,扩成多样训练轨迹
EMBODIEDSWE-GEN负责把专用解法转成可训练数据。它从五个层级做变化:替换场景与物体,改变整体策略,调整任务阶段和中间状态,添加动力学与动作扰动,最后改变背景、光照和摄像机。上层变化扩展任务结构,下层变化提高对视觉与物理扰动的适应性。
图:Figure 7从一个验证解法出发,分别改变场景、策略、阶段、动力学和视觉条件,生成覆盖更广的训练轨迹。
VLA的表现随生成示范数增加而提高,Agent辅助的多样化也改善了对留出任务变体的泛化。论文还让一个只用编程Agent生成仿真示范微调的VLA完成真机长时序任务。这是一项真机迁移结果,不代表基准中所有任务都已在真机成功。
后续需要降低Agent迭代一个验证解法的计算成本,并检验自动扩展的轨迹是否保持物理可行和任务语义正确。如果这两个门槛能压低,编程智能体可以把少量昂贵解法转成更大规模的机器人监督数据。
这套流程把编程Agent放在离线数据生产环节,而不是直接让它在真机上自由试错,因而更容易加入验证和筛选。真正规模化时,每条合成轨迹仍需检查是否完成任务、是否违反碰撞约束,以及视觉变化是否改变了原任务含义。论文展示了从仿真数据到真机任务的可行案例,但尚不能说明所有自动生成数据都同样有效;数据数量增加与有效多样性增加也需要分开衡量。