Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
超越模仿:基于离线Q规划的机器人策略自改进
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。
Comments Project page with videos: this https URL (https://varungiridhar.github.io/qplanning/)