arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

卡内基梅隆让机器人边做边用自然语言推理,两套长任务基准均超过模仿学习

作者:arXivDaily编辑部 arXiv 2608.26053 cs · cs.AI · cs.CL · cs.LG · cs.RO

长任务中,机器人要记住哪些物体已经移动、当前动作是否失败,以及下一步会不会挡住后续操作。卡内基梅隆大学提出R³,让视觉语言模型在每次低层动作前用自然语言分析场景、进度与替代计划,再把文字指导交给操作策略。

方法在Language Table和仿真双臂杂货打包两套受控环境中测试,在未见任务上显著超过只读指令的模仿学习基线。论文把语言推理视为测试时额外计算,但尚未在开放环境真实机器人上验证。

先模仿专家推理风格,再用动作数据强化

R³分两阶段训练。中期训练使用专家生成的推理轨迹,让模型学会描述对象关系、拆分目标、检查历史和提出下一步。随后从离线动作数据构造单步评分规则,用强化学习提高能带来有效动作的推理。

项目页流程:专家推理中期训练建立语言格式,离线动作评分再优化决策。

强化阶段不要求每条推理都有唯一标准答案。评分关注推理产生的指导是否匹配任务状态和有效动作,使模型可以保留自由文本,同时接受可执行结果约束。

论文把强化学习限制在单步离线动作数据上,避免为每段长推理搭建昂贵在线机器人训练。模型先生成语言指导,评分规则根据对应动作和任务状态给反馈。这样训练成本较低,但奖励只覆盖数据中出现的状态,真实失败后的新局面仍可能超出经验范围。

语言负责跟踪进度与发现替代方案

结构化机器人推理常输出固定对象槽位或动作标签。R³允许模型写自由语言,在测试时增加思考长度。它可以复述已完成步骤、比较两条路径,并在目标被遮挡时结合历史判断对象可能位置。

项目页样例:红色物体被机械臂遮挡后,模型重新检查场景、任务和历史再发出动作。

自由语言也可能产生听起来合理却不对应画面的内容。论文用动作结果和视觉问答诊断区分静态感知与操作收益,发现推理训练同时改善部分感知,但单纯提高视觉问答不能解释全部操作提升。

两套基准都超过仅指令模仿学习

Language Table要求单臂在桌面移动彩色几何体,测试组合关系、遮挡和未见任务。R³在中期训练任务、强化学习任务和分布外保留任务的平均成功率上都优于相应模仿基线。

项目页主结果:基础模型、模仿学习与R³在Language Table多组任务上的平均成功率。

双臂杂货打包包含12个保留任务,需要安排物体顺序、双臂配合和长时进度。论文同时报告成功率与归一化进度;即使未完全完成,进度指标也能区分模型卡在第一步还是接近收尾。

项目页打包实验:12个保留任务上的平均成功率与归一化进度。

下一步:真实机器人要控制语言延迟和错误累积

当前两套环境适合研究推理机制,却没有覆盖真实相机噪声、抓取滑动和人员进入工作区。自由文本推理还会增加推理时间,若每个低层动作都等待长输出,控制频率会下降。

下一步需要在真实双臂平台上测量语言生成延迟、动作失败后的恢复率,以及推理内容与实际状态的一致性。产品化时还应限制推理器能调用的动作范围,让低层安全控制器拒绝越界命令;语言可用于计划和纠错,不能替代实时安全约束。

评测还应同时保留“说了什么”和“做了什么”的时间戳。若语言判断正确而执行器失败,应改进低层策略;若动作偶然成功但推理引用了不存在的物体,则不能把它当成可靠规划。把两类错误分开,才能判断额外测试时算力是否真的用于任务推理,而非生成更长的解释文本。

参考资料

https://arxiv.org/abs/2608.26053

https://arxiv.org/html/2608.26053

https://robotic-reasoner.github.io/