arXivDaily arXiv每日学术速递 周一至周五更新

作者

Sergey Levine

Robotics / Reinforcement Learning

2026-06-10 至 2026-06-10 共收录 2
2606.11087 2026-06-10 cs.LG cs.AI 新提交

Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

强化学习中流策略的测试时梯度引导

Zhiyuan Zhou, Andy Peng, Charles Xu, Qiyang Li, Tobias Springenberg, Kevin Frans, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) Physical Intelligence

AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏