Reinforcement Learning for Real-Time Vision-Language-Action Policies
面向实时视觉-语言-动作策略的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 针对VLA模型推理延迟导致动作过时的问题,提出Real-Time EXPO-FT框架,通过解耦动作生成与编辑实现实时强化学习微调,在Kinetix基准和动态真实世界任务中显著提升性能。
作者
Robotics / Machine Learning
面向实时视觉-语言-动作策略的强化学习
机构 * Stanford University(斯坦福大学)
AI总结 针对VLA模型推理延迟导致动作过时的问题,提出Real-Time EXPO-FT框架,通过解耦动作生成与编辑实现实时强化学习微调,在Kinetix基准和动态真实世界任务中显著提升性能。
WHALE:一种用于联合 harness-权重优化的简单方案
机构 * KRAFTON(克拉夫顿公司) ; KAIST(韩国科学技术院) ; Stanford University(斯坦福大学)
AI总结 该研究针对智能体性能受模型权重与 harness 代码单独优化瓶颈的问题,提出 WHALE 交替优化方案,结合在线拒绝采样微调与 Meta-Harness,在多领域 Qwen 智能体上较基线方法提升了准确率与 rollout 效率。
在仿真环境中预训练视觉灵巧性
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Scale AI(Scale AI公司)
AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。
Comments Project page: https://spd.bot
结合世界模型的Q学习
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。
EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调
机构 * Stanford University(斯坦福大学)
AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。
SpeedTuning:用轻量强化学习加速策略执行
机构 * Stanford University(斯坦福大学)
AI总结 SpeedTuning是一种轻量强化学习框架,可预测动作最优执行速度,在无需额外数据采集的情况下,将机器人操作策略加速超2.4倍且保持足够成功率,适用于多种动态精确任务。
Comments 10 pages, 12 figures. This arXiv version includes an appendix with qualitative simulation rollouts and additional ablations. Published at ICRA 2025
Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA), pp. 1184-1192, 2025
在线RL微调真的需要预训练Q函数吗?
机构 * Stanford University(斯坦福大学)
AI总结 本文针对在线RL微调是否需预训练Q函数的问题,发现预训练Q函数增益有限,提出IPE方法,在连续控制基准中使微调性能平均提升1.26倍。
Comments Fixed typo in author name
自由形式偏好学习用于机器人操作
机构 * Stanford University(斯坦福大学)
AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。
LLM-as-a-Verifier:一种通用验证框架
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA Research(英伟达研究院)
AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。
Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com
SPIRAL: 学习搜索与聚合
机构 * Stanford University(斯坦福大学)
AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。
Comments Ongoing Work
通过流反转引导改进机器人通用策略
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。
DIRECT: 在具身规划器中何时何地分配测试时计算?
机构 * Stanford University(斯坦福大学) ; University of Waterloo(滑铁卢大学) ; NVIDIA(英伟达)
AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。
CHORUS: 基于单一VLA策略的去中心化多体协作
机构 * Stanford University(斯坦福大学)
AI总结 提出CHORUS框架,利用预训练视觉-语言-动作模型的视觉运动先验,实现无需推理时通信的去中心化多机器人协作,在真实实验中显著优于基线。
Comments Project Website: https://chorus-model.github.io
Ego-Pi: 面向自我中心人类与机器人数据的VLA微调
机构 * Stanford University(斯坦福大学) ; Meta
AI总结 为解决机器人数据稀缺问题,利用自我中心人类数据,基于π₀.₅模型微调,使机器人学习新任务语义并组合现有技能,无需对应机器人数据。
Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型
机构 * Open-H-Embodiment Consortium ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学) ; University of Tokyo(东京大学) ; University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) ; University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)
AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。
Comments Project website: https://open-h.github.io/open-h-embodiment/
Value Flows
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 本文利用基于流的生成模型估计完整未来回报分布,通过新的流匹配目标满足分布贝尔曼方程,并利用流导数ODE估计回报不确定性以优先学习,在离线与在线设置中平均成功率提升1.3倍。
Comments ICLR 2026
World Action Verifier: 通过前向-反向不对称性自我改进世界模型
机构 * Stanford University(斯坦福大学) ; UC San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学)
AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。
Comments Project Website: https://world-action-verifier.github.io
RoboMME:机器人通用策略的记忆基准与理解
机构 * University of Michigan(密歇根大学) ; Stanford University(斯坦福大学) ; Figure AI
AI总结 提出RoboMME基准,通过16个操作任务评估VLA模型在长时程和历史依赖场景中的记忆能力,并基于π0.5骨干网络探索14种记忆增强变体,发现记忆表示的有效性高度依赖于任务。
Comments Accepted to ICML 2026
长周期Q学习:通过n步不等式实现准确的价值学习
机构 * Stanford University(斯坦福大学)
AI总结 本文提出长周期Q学习(LQL),通过引入n步不等式来抑制误差累积,提升长周期学习稳定性,实验表明其在多种基准上优于传统TD方法。
EXPO: 通过表达性策略进行稳定的强化学习
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 EXPO通过构建实时策略最大化Q值,提升样本效率,适用于基于离线数据的策略微调和在线训练。
Comments changed formatting, added code
多色目标用于强化学习
机构 * Stanford University(斯坦福大学)
AI总结 本文提出多色目标用于强化学习,通过强制探索和多样化生成来改进预训练策略,实验表明在多个任务中提升了成功率和泛化能力。
$π_{0.7}$: 一种可定向的通用机器人基础模型与涌现能力
机构 * Physical Intelligence
AI总结 $π_{0.7}$通过多样化的上下文条件训练,实现跨环境任务执行与零样本泛化,支持多阶段任务和复杂操作,如咖啡机操作,性能媲美专门强化学习微调模型。
Comments Website: https://www.pi.website/blog/pi07
FASTER:基于价值引导的快速强化学习采样
机构 * Stanford University(斯坦福大学)
AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。
Poly-EPO:训练探索性推理模型
机构 * Stanford University(斯坦福大学)
AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。
测试时对齐 via 假设重加权
机构 * Stanford University(斯坦福大学)
AI总结 本文提出HyRe方法,通过重加权集成成员实现实时个性化,仅需1-5个标记示例即可超越现有奖励模型。
Comments TMLR 2026
FSPO:少样本优化合成偏好以个性化真实用户
机构 * Stanford University(斯坦福大学) ; OpenAI ; Google DeepMind(谷歌DeepMind)
AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。
Comments Website: https://fewshot-preference-optimization.github.io/
GIANTS:从科学文献生成洞察预判
机构 * Stanford University(斯坦福大学) ; New York University(纽约大学)
AI总结 本文提出GIANTS任务,通过生成模型预测下游论文的核心洞察,开发了包含17000个示例的GIantsBench基准,展示了GIANTS-4B模型在多个领域中的优越性能,其生成的洞察在概念清晰度和引用潜力上均优于基线模型。
Meta-Harness:端到端优化模型Harness
机构 * Stanford(斯坦福大学) ; KRAFTON ; MIT(麻省理工学院)
AI总结 本文提出Meta-Harness,通过自动搜索优化模型Harness代码,提升文本分类、数学推理和编程任务性能,减少上下文token使用量。
数据类比促进高效的跨机体迁移
机构 * Stanford University(斯坦福大学)
AI总结 研究探讨了如何通过数据类比提升机器人跨机体迁移效率,发现结构化多样性在感知变化中效果显著,而形态变化则更依赖数据类比。
Comments 14 pages, 11 Figures, 6 Tables
MEM:多尺度具身记忆用于视觉语言动作模型
AI总结 MEM通过结合多模态记忆实现长期视觉语言动作任务的高效执行与适应性策略调整。
Comments Website: https://pi.website/research/memory