Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
Yang Chen, Menglin Zou, Jiaqi Zhang, Yitan Zhang, Junyi Yang, Gael Gendron, Libo Zhang, Jiamou Liu, Michael J. Witbrock
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
University of Auckland(奥克兰大学)
;
Chongqing University(重庆大学)
专题命中
模仿学习与强化学习
:robotics(abstract);分类 cs.AI、cs.LG
CommentsAccepted to NeurIPS 2025. Title used at submission and review: PIRO: Toward Stable Reward Learning for Inverse RL via Monotonic Policy Divergence Reduction
机构
*
Graduate School of Informatics, Nagoya University, Japan(名古屋大学信息学研究科)
;
RIKEN Center for Advanced Intelligence Project, Japan(RIKEN高级智能项目研究中心)
;
Graduate School of Arts and Sciences, The University of Tokyo, Japan(东京大学文学系研究科)
;
Project team for SIP, Japan(SIP项目团队)
;
Japan Agency for Marine-Earth Science and Technology, Japan(日本海洋地球科学技术机构)
;
Faculty of Education, Shitennoji University, Japan(世田谷大学教育学部)
;
Graduate School of Engineering, The University of Tokyo, Japan(东京大学工学研究科)
;
Graduate School of Science and Technology, Niigata University, Japan(新潟大学科学技术研究科)
;
Graduate School of Science, Nagoya University, Japan(名古屋大学理学研究科)
;
Principles of Informatics Research Division, National Institute of Informatics, Japan(信息学原理研究部门,日本信息处理技术研究所)
;
Graduate School of Information Science, The University of Osaka, Japan(大阪大学信息科学研究科)