From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
从演示到奖励:VLM奖励模型的测试时提示优化
机构 * University of Amsterdam(阿姆斯特丹大学) ; Catholic University of Leuven(鲁汶天主大学) ; Toyota Research Institute(丰田研究院) ; Toyota Motor Europe(丰田欧洲公司)
专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出Demo2Reward方法,利用少量专家演示在测试时优化VLM奖励模型的提示指令,减少假阳性并保持真阳性,无需额外训练即可提升下游策略学习。