Debiased Model-based Representations for Sample-efficient Continuous Control
去偏的基于模型的表示用于样本高效的连续控制
机构 * Tencent Hunyuan(腾讯文言) ; McGill University(麦吉尔大学) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DR.Q算法,通过最大化当前状态-动作对表示与下一状态之间的互信息,并采用衰减优先经验回放,以减少表示和actor-critic学习中的偏差,从而在连续控制任务中取得优于现有方法的性能。
Comments ICML 2026