FASTER: Value-Guided Sampling for Fast RL
FASTER:基于价值引导的快速强化学习采样
机构 * Stanford University(斯坦福大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
FASTER:基于价值引导的快速强化学习采样
机构 * Stanford University(斯坦福大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。
通过增量迭代参考学习控制细化加速演示
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) ; University of Tsukuba(茨口大学) ; Waseda University(早稻田大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出I2RLC方法,通过逐步提升速度并更新参考轨迹,实现高保真度的加速演示,提升接触密集模仿学习的效率与稳定性。
Comments 8 pages, 11 figures, submitted to IROS 2026
AtManRL:通过可微注意力显著性实现更忠实的推理
机构 * Aleph Alpha Research Lab(Aleph Alpha研究实验室) ; TU Darmstadt(图林根大学) ; Hessian.AI Lab(黑森AI实验室)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AtManRL方法,通过可微注意力操控学习更忠实的推理过程,结合GRPO框架优化正确性与可解释性,实验证明能识别关键推理token并提升模型透明度。
Comments 14 pages, 8 figures, 1 table
机构 * TU Darmstadt(图宾根大学) ; DFKI(德累斯顿人工智能研究所) ; Intrinsic ; Lab1141(Lab1141实验室) ; CERTAIN, Germany(德国CERTAIN) ; MPI-Inf, SIC(慕尼黑人工智能研究所) ; Meta
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
基于模型的强化学习在随机观测延迟下的应用
机构 * Department of Computer Science(计算机科学系) ; University of California, Irvine(加州大学尔湾分校)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了POMDPs中的随机传感器延迟问题,提出了一种基于模型的过滤过程和延迟感知框架,以提升强化学习在随机延迟环境中的性能。
通过耦合模型预测控制和深度强化学习实现多智能体场景下的非保守自动驾驶
机构 * TU Delft, Faculty of Civil Engineering and Geosciences, Department of Transport and Planning(代尔夫特理工大学,土木工程与地质科学学院,交通与规划系) ; NVIDIA
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出结合MPC与RL的框架,提升多智能体场景下的导航性能,实验表明MPC-RL在碰撞率和成功率上优于传统方法,且在零样本迁移中表现更优,展示了MPC对跨场景鲁棒性的贡献。
Comments This work has been submitted to the IEEE for possible publication
通过统计和语义过滤进行模仿学习中的故障识别
机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) ; Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) ; Bleu Robotics(Bleu机器人)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。
Comments 8 pages, Appendix coming soon, accepted at ICRA 2026
学习协助:通过多智能体强化学习实现物理基础的人机控制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。
Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/
SafeAdapt: 在深度强化学习中提供安全的策略更新
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SafeAdapt方法,通过引入Rashomon集在连续强化学习中提供安全策略更新的正式保证,确保在下游适应过程中源任务的安全性。
Comments Code available at: https://github.com/maxanisimov/provably-safe-policy-updates
基于优势的扩散模型用于基于模型的强化学习
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; Digital Futures(数字未来)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AGD-MBRL,通过利用智能体的优势估计引导反向扩散过程,提升长周期回报。采用SAG和EAG两种引导方法,改进了短周期视角下的扩散模型MBRL性能。
提升分布强化学习:分析与医疗应用
机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。
Comments Preprint. 40 pages,11 figures. Supplementary appendix included
单样本适应人类全身体态与行走先验
机构 * Embodied AI and Robotics (AIR) Lab, NYUAD(纽约大学阿布扎比分校具身人工智能与机器人实验室) ; NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) ; New York University Abu Dhabi(纽约大学阿布扎比分校) ; Harvard Ophthalmology AI Lab, Harvard University(哈佛大学眼科人工智能实验室)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI
AI总结 本文提出一种高效适应全身体态的方法,利用行走先验和单样本目标生成中间姿态,通过最优传输和几何插值实现碰撞自由配置,实验显示优于基线方法。
Comments 14 pages, 3 figures, 5 tables
何时提问:用于强化学习的不确定性门控语言帮助
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。
Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)
奥拉夫:将动画角色带入现实世界
机构 * Disney Research Imagineering(迪士尼研究与工程)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文通过强化学习结合动画参考,使奥拉夫在现实世界中活动,采用软泡沫裙隐藏不对称腿部,利用球形和平面连杆实现动作控制,并通过温度输入和额外奖励减少过热风险,验证了其在仿真和硬件中的有效性。
由代理驱动的自主强化学习研究:四足运动的迭代策略改进
机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI
AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。
基于约束乐观探索的非策略安全强化学习
机构 * Faculty of Mechanical Engineering(机械工程学院) ; Delft University of Technology(代尔夫特理工大学) ; Faculty of Electrical Engineering, Mathematics and Computer Science(电气工程、数学和计算机科学学院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出COX-Q算法,通过约束乐观探索和保守离线分布价值学习,解决非策略安全强化学习中的约束违反问题,实现在安全关键应用中的高效样本利用和可控数据收集成本。
Comments 21 pages, 9 figures, accepted by ICLR 2026 poster
通过解析动力学正则化实现物理信息的策略优化
机构 * EmPACT Lab, Nanyang Technological University, Singapore(EmPACT实验室,南洋理工大学,新加坡)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文提出PIPER框架,通过在神经策略优化中引入解析软物理约束,提升机器人控制的效率和物理一致性。
Comments 11 pages, 8 figures
一种用于提升长周期LLM代理的子目标驱动框架
机构 * Google DeepMind(谷歌DeepMind)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。
Comments 50 pages, 15 figures
警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击
机构 * Khoury College of Computer Sciences(计算机科学学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。
Comments 10 pages main body, ICLR 2026
基于视觉语言模型的递归推理用于估计长周期具身任务进度
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。
Comments CVPR 2026
受动态时序逻辑约束的防护强化学习
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 本文提出一种结合序列控制屏障函数和无模型强化学习的框架,以满足复杂的时序逻辑任务,扩展了传统安全约束的应用范围。
Comments 7 pages, 3 figures, 2026 IEEE American Control Conference (ACC)
奖励DINO:基于视觉基础模型预测密集奖励
机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) ; TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出Rewarding DINO,一种基于语言条件的奖励模型,通过学习实际奖励函数而非特定轨迹,实现机器人操作任务的密集奖励预测,具有紧凑结构和低计算开销,能有效泛化至新场景。
Comments 10 pages, 5 figures, submitted to IEEE
通过虚拟鱼运动的强化学习控制鱼群
机构 * Faculty of Engineering, Kyoto University(京都大学工学部)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文通过强化学习训练虚拟鱼,实现对鱼群的引导与控制,实验证明该方法在模拟和实际环境中均能有效引导鱼群向目标方向移动,优于基线方法。
Comments English translation of the author's 2018 bachelor's thesis. Keywords: fish schooling, reinforcement learning, collective behavior, artificial agents, swarm-machine interaction
CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器
机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI
AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。
S2Act: 简单的脉冲行为者
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 S2Act通过构建基于速率脉冲神经元的actor-critic模型,利用梯度训练并转换为物理参数,有效解决SNN中的梯度消失问题,提升多机器人任务的实时推理性能。
Comments This work has been submitted to the IEEE for possible publication
MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Clemson University(克莱姆斯大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。
Comments 7 pages, 6 figures
PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用
机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) ; Xiaomi EV(小牛电动车) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV
AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。
Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7
ICPRL: 从交互控制中获取物理直觉
机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Alibaba Group(阿里巴巴集团) ; RUC(中国人民大学) ; PUC-Rio(里约热内卢联邦大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG
AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。
Comments 22 pages
通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应
机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Austrian Institute of Technology GmbH(奥地利技术研究所)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。
部分等价强化学习在对称破坏环境中
机构 * School of Mechanical Engineering, Yonsei University, Seoul, South Korea(延世大学机械工程学院,首尔,韩国) ; Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系,首尔,韩国) ; Department of Mechanical Engineering, University of California, Berkeley, United States(加州大学伯克利分校机械工程系,美国)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出部分等价强化学习框架,通过选择性应用群不变或标准贝尔曼备份,提升样本效率和泛化能力,适用于对称破坏环境的离散和连续控制任务。
Comments ICLR 2026