Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning
强化学习中流策略的测试时梯度引导
机构 * UC Berkeley(加州大学伯克利分校) ; Physical Intelligence
AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。
作者
Robotics / Reinforcement Learning
强化学习中流策略的测试时梯度引导
机构 * UC Berkeley(加州大学伯克利分校) ; Physical Intelligence
AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。
CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力
机构 * University of California Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学)
AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。