When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning
当生活给你行为克隆,就做Q函数:从行为克隆中提取Q值用于机器人强化学习
机构 * Rai-Inst
AI总结 提出Q2RL算法,通过从行为克隆策略中提取Q函数并利用Q门控切换策略,实现高效的离线到在线强化学习,在机器人操作任务中达到100%成功率和3.75倍提升。
Comments Robotics: Science and Systems, 2026