Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
Robo-Dopamine:高精度机器人操作的通用过程奖励建模
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机学院,北京大学) ; Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) ; University of Sydney(3 新南威尔士大学) ; Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title);robotics(abstract);分类 cs.RO
AI总结 Robo-Dopamine通过多视角奖励融合和分步奖励离散化,提出了一种通用过程奖励模型,提升机器人操作的精准度和策略学习效率。
Comments 27 pages, 11 figures