Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback
编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器
Kang Peng, Zhiwei Zhang, Yichen Zhang, Zezhong Wang, Yiming Du, Geng Tu, Baojun Wang, Bin Liang, Ruifeng Xu, Kam-Fai Wong
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Chinese University of Hong Kong(香港中文大学)
;
Huawei Technologies Co., Ltd.(华为技术有限公司)
;
Harbin Institute of Technology(哈尔滨工业大学)