Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning
强化学习中流策略的测试时梯度引导
机构 * UC Berkeley(加州大学伯克利分校) ; Physical Intelligence
AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。
作者
Robotics / Reinforcement Learning
强化学习中流策略的测试时梯度引导
机构 * UC Berkeley(加州大学伯克利分校) ; Physical Intelligence
AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。