Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
重播失败作为成功:用于指令跟随的样本高效强化学习
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Dalian University of Technology(大连理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Alibaba Cloud Computing(阿里云计算) ; Chinese Academy of Sciences(中国科学院)
AI总结 HiR 提出了一种样本高效强化学习框架,通过将失败尝试视为成功来提升指令跟随任务的性能,利用双偏好学习实现高效优化。