SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation
SARM:面向长时间 horizon 的机器人操控阶段感知奖励建模
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出一种基于视频的阶段感知奖励建模框架,通过自然语言子任务标注实现一致标签,提升长horizon任务的鲁棒性和泛化能力,实验表明其在真实世界和人类验证中表现优异。
作者
Robotics
SARM:面向长时间 horizon 的机器人操控阶段感知奖励建模
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出一种基于视频的阶段感知奖励建模框架,通过自然语言子任务标注实现一致标签,提升长horizon任务的鲁棒性和泛化能力,实验表明其在真实世界和人类验证中表现优异。