OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
OPRIDE: 通过数据集内探索实现离线偏好驱动强化学习
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; Tsinghua University(清华大学) ; Moonshot AI(月之暗面) ; Amazon(亚马逊) ; University of Arizona(亚利桑那大学) ; Washington University in St. Louis(圣路易斯华盛顿大学)
AI总结 本文提出OPRIDE算法,通过改进探索策略和折扣调度机制提升离线偏好驱动强化学习的查询效率,实验表明其在多种任务中表现优异。
Journal ref ICLR-2026