From "Thumbs Up" to "10 out of 10": Reconsidering Scalar Feedback in Interactive Reinforcement Learning
从' thumbs up '到' 10 分之 10 ':重新考虑交互强化学习中的标量反馈
机构 * Tufts University School of Engineering, Computer Science(塔夫茨大学工程学院计算机科学系) ; Tufts University School of Engineering, Mechanical Engineering(塔夫茨大学工程学院机械工程系)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出STEADY方法,通过处理标量反馈提升机器人抓取任务中的学习效果,证明标量反馈在适当处理下对强化学习有益。
Journal ref IROS 2023