Leveraging Discrete Function Decomposability for Scientific Design
利用离散函数分解进行科学设计
AI总结 本文提出DADO算法,通过利用设计变量的分解结构,提升离散空间优化效率,用于科学设计问题。
作者
Robotics / Reinforcement Learning
利用离散函数分解进行科学设计
AI总结 本文提出DADO算法,通过利用设计变量的分解结构,提升离散空间优化效率,用于科学设计问题。
传递式强化学习:基于分而治之的价值学习
AI总结 本文提出传递式强化学习算法,通过分而治之策略解决离线目标条件强化学习问题,有效降低偏见累积和方差,实现长horizon任务中的最优性能。
Comments ICLR 2026
多步准度量学习用于可扩展的目标导向强化学习
AI总结 本文提出了一种基于多步准度量学习的离线目标导向强化学习方法,通过多步蒙特卡洛回报提升长视野任务的性能,并在现实世界机器人操作中实现了多步拼接。
Journal ref ICLR (2026)
双目标表示
AI总结 本文提出双目标表示,通过时序距离集合表征状态,提升离线目标到达性能。
Comments ICLR 2026
AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航
机构 * University of California, Berkeley(加州大学伯克利分校) ; Toyota Motor North America(丰田汽车北美公司) ; Princeton University(普林斯顿大学)
AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。
Comments 13 pages, 9 figures, 2 tables
SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Microsoft(微软公司)
AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。
自然语言行为-批评者:在语言空间中可扩展的非策略学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。
Comments 21 pages, 4 figures
π₀:一种面向通用机器人控制的视觉-语言-动作流模型
机构 * Physical Intelligence
AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。
Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025
RoboReward: 通用视觉-语言奖励模型用于机器人学
AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。
PolaRiS:面向通用机器人策略的可扩展真实-仿真评估
机构 * University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Toyota Research Institute(丰田研究中心) ; University of Southern California(南加州大学) ; Cornell University(康奈尔大学)
AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。
Comments Website: https://polaris-evals.github.io/
视觉-语言-动作模型中人类到机器人的转移现象出现
机构 * Physical Intelligence(物理智能) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出了一种简单的方法,通过预训练视觉-语言-动作模型,使模型能从人类数据中学习并转移至机器人任务,从而提升泛化性能。
无开销的适应性测试时间计算 introspection
机构 * UC Berkeley(加州大学伯克利分校) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Liquid AI
AI总结 ZIP-RC通过无开销的实时自我反省预测奖励和成本,提升推理效率和准确性。
后验行为克隆:为高效强化学习微调预训练BC策略
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学)
AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。
解耦的Q分块
AI总结 本文提出了解耦的Q分块算法,通过分离批评者和策略的分块长度,解决了长分块策略建模困难和开环次优问题,在离线目标条件任务中表现优异。
Comments 76 pages, 14 figures
可扩展的基于模型的强化学习与动作块
AI总结 本文提出MAC方法,通过动作块模型和拒绝采样提升离线基于模型的强化学习在复杂长 horizon 任务中的性能。
Comments 22 pages, 7 figures
训练时的动作条件化以实现高效的实时分块
机构 * Physical Intelligence(物理智能)
AI总结 本研究提出在训练时模拟推理延迟并直接条件化动作前缀,以实现更高效、计算成本更低的实时机器人控制。
实时执行动作分块流策略
机构 * Physical Intelligence(物理智能) ; UC Berkeley(伯克利大学)
AI总结 本文提出实时分块(RTC)方法,通过在执行当前动作分块的同时生成下一个分块,实现动作分块策略的实时异步执行,提升任务吞吐量和精确任务成功率。
Comments published in NeurIPS 2025
无需搜索的规划:通过离线目标条件强化学习精炼前沿大语言模型
机构 * UC Berkeley(伯克利大学)
AI总结 通过目标条件价值函数引导LLM推理,实现高效多轮交互规划,优于传统RL微调和提示方法。
Comments Published at NeurIPS 2025; 18 pages, 4 figures, 2 tables
离线目标条件强化学习与准度量表示
AI总结 本文提出了一种结合对比表示和时间距离的离线目标条件强化学习方法,利用准度量表示空间结构和约束,实现最优目标到达,提升缝合任务和高维环境下的性能。
RoboArena: 分布式现实世界中通用机器人策略的评估
AI总结 RoboArena通过分布式众包评估,实现了对通用机器人策略在现实世界中的可扩展、可靠评估,优于传统集中化方法。
Comments Website: https://robo-arena.github.io/
基于模型的重新标注:学习在任何地方驾驶
机构 * Department of Electrical Engineering and Computer Sciences , University of California, Berkeley, CA USA(电气工程与计算机科学系,加州大学伯克利分校) ; Toyota Motor North America, Inc(丰田北美公司) ; Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)
AI总结 本文提出基于模型的重新标注框架,利用被动数据训练出高效导航策略,实现机器人在复杂环境中的长距离稳健导航。
Comments 9 pages, 8 figures, 6 tables
Journal ref IEEE Robotics and Automation Letters 2025
机构 * Physical Intelligence
机构 * Shanghai Jiao Tong University(上海交通大学) ; UC Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学)
Comments Project page: https://mianwu01.github.io/RLAC_website/
机构 * UC Berkeley(伯克利大学) ; University of Washington(华盛顿大学) ; Google DeepMind(谷歌DeepMind)
机构 * UC Berkeley(伯克利大学)
机构 * UC Berkeley(伯克利大学)
机构 * UC Berkeley(伯克利大学) ; Physical Intelligence(物理智能)
Comments 7 pages and appendix
机构 * University of California, Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
Comments NeurIPS 2025
机构 * UC Berkeley(伯克利大学) ; University of Oxford(牛津大学) ; University of Washington(华盛顿大学) ; UK AI Security Institute(英国人工智能安全研究所) ; Google DeepMind(谷歌DeepMind)