Transitive RL: Value Learning via Divide and Conquer
传递式强化学习:基于分而治之的价值学习
AI总结 本文提出传递式强化学习算法,通过分而治之策略解决离线目标条件强化学习问题,有效降低偏见累积和方差,实现长horizon任务中的最优性能。
Comments ICLR 2026
作者
Robotics / Reinforcement Learning
传递式强化学习:基于分而治之的价值学习
AI总结 本文提出传递式强化学习算法,通过分而治之策略解决离线目标条件强化学习问题,有效降低偏见累积和方差,实现长horizon任务中的最优性能。
Comments ICLR 2026
多步准度量学习用于可扩展的目标导向强化学习
AI总结 本文提出了一种基于多步准度量学习的离线目标导向强化学习方法,通过多步蒙特卡洛回报提升长视野任务的性能,并在现实世界机器人操作中实现了多步拼接。
Journal ref ICLR (2026)