When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning
当生活给你行为克隆,就做Q函数:从行为克隆中提取Q值用于机器人强化学习
机构 * Rai-Inst
专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI;robotics(comments)
AI总结 提出Q2RL算法,通过从行为克隆策略中提取Q函数并利用Q门控切换策略,实现高效的离线到在线强化学习,在机器人操作任务中达到100%成功率和3.75倍提升。
Comments Robotics: Science and Systems, 2026