Density Matching Reward Learning
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG;robotics(comments)
Comments Submitted to Workshop on Algorithmic Foundations of Robotics (WAFR)
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG;robotics(comments)
Comments Submitted to Workshop on Algorithmic Foundations of Robotics (WAFR)
基于视觉的目标到达控制的移动机器人Hierarchical Learning框架
机构 * Faculty of Engineering and Natural Sciences, Tampere University(工程与自然科学学院,塔尔皮莱大学)
专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO
AI总结 本文提出一种基于视觉的目标到达控制框架,通过分层学习方法提高移动机器人在复杂地形中的安全性和稳定性。
Comments Published in Robotics and Autonomous Systems, Volume 206, Article 105710
Journal ref Robotics and Autonomous Systems 206 (2026) 105710
基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中
机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) ; Differential Robotics(微分机器人)
专题命中 模仿学习与强化学习 :navigation(abstract);robotics(comments,journal_ref);分类 cs.RO
AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。
Comments Published in IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, 2026
专题命中 模仿学习与强化学习 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO
Comments 21 pages, 17 figures (accepted in Robotics and Autonomous Systems)
Journal ref Robotics and Autonomous Systems, 2025
专题命中 模仿学习与强化学习 :navigation(abstract,comments);分类 cs.RO;robotics(comments)
Comments Perception and Navigation for Autonomous Robotics in Unstructured and Dynamic Environments (PNARUDE) workshop in IROS 2022
专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2018, 6 pages, 6 figures
Journal ref 2018 IEEE International Conference on Robotics and Automation (ICRA)
等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调
机构 * Siemens(西门子) ; UC Berkeley(加州大学伯克利分校) ; Microsoft(微软) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。
Comments 25 pages, 12 figures
一种用于机器人行为的基于fNIRS引导的强化学习的离线方法
专题命中 模仿学习与强化学习 :robot learning(abstract);分类 cs.RO、cs.AI
AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。
Comments Preliminary results
任务对齐的学习引导控制:公式与基础
机构 * Czech Technical University in Prague(捷克布拉格工业大学) ; Norwegian University of Science and Technology(挪威科技大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出一种任务对齐的学习引导控制框架,结合控制、经典规划和强化学习,提升自主系统安全性和可靠性。
SRL-MPC:形状感知强化学习模型预测控制
机构 * The University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学) ; University of Michigan(密歇根大学) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 针对异构人群与机器人集群的形状感知导航难题,提出SRL-MPC方法,结合MPC的安全泛化性与RL的适应性,实验显示其在安全性、适应性上优于基准方法。
MLREF:基于大语言模型的强化学习奖励设计中高效模块复用框架
机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对强化学习奖励设计瓶颈,提出MLREF框架,通过模块池复用奖励组件,结合三种优化机制,在17个任务上实现比强基线更优且更稳定的性能。
Comments 22 pages, 5 figures, 4 tables
重复作为强化:通过强化学习中的即时回合重复提升样本效率
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 受人类学习的重复机制启发,提出即时回合重复(IER)机制,将其集成至 SAC、TD3 算法并在多类基准任务上验证,可提升强化学习的样本效率与学习性能。
Comments 23 pages, 12 figures. Accepted at RLC 2026; to appear in Reinforcement Learning Journal (RLJ) 2026. Code: https://github.com/UoA-CARES/instant-episode-repetition
用于强化学习的时序逻辑引导通用任务表示
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) ; Chinese Academy of Sciences(中国科学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出受时序逻辑启发的通用任务表示框架LOTUS,将其集成至强化学习算法,通过LTL编码器建模语义、双模拟度量保障稳定性,在多场景下的学习效率、泛化能力等指标优于现有方法。
Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (Early Access). Project page: https://lotus-website.github.io/
CORAL:面向基于激光雷达的目标导向城市驾驶的课程优化奖励适配
机构 * Korea University of Technology and Education (KOREATECH)(韩国技术教育大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG
AI总结 CORAL结合五阶段课程与阶段感知奖励,在CARLA中训练多流演员-评论家策略,实现基于激光雷达的城市驾驶,长路线约束下成功率显著优于PPO基线,且可零样本跨城镇迁移。
Comments 13 pages, 6 figures
轨迹优先:发现多样化策略的课程
机构 * TU Berlin(柏林技术大学) ; Robotics Institute(机器人研究所)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出一种两阶段课程,通过轨迹先验生成多样化高奖励行为,再蒸馏为反应式策略,提升任务性能与行为多样性。
Comments Best paper at the Inductive Biases in Reinforcement Learning Workshop at RLC 2025
Journal ref Reinforcement Learning Journal 2026
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
Journal ref Knowledge-Based Systems, 322 (2025) 113689
面向具身控制的动作与语言条件视频评估
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。
Comments 21 pages, 7 figures, Published in Sensors
Journal ref Sensors 26(16), 5046 (2026)
V-Simba:释放强化学习在视觉连续控制中的架构潜力
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 该研究针对视觉RL样本效率低的问题,提出受Simba架构启发的V-Simba视觉RL架构,基于SAC改进后在多个基准测试中性能优于或媲美现有方法,且计算效率更高。
Comments Accepted at RLC'26
TEMPO:面向视觉-语言-动作模型的语义-动作解耦强化学习后训练
机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) ; KTH Royal Institute of Technology(瑞典皇家理工学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本文提出TEMPO框架,通过解耦语义投影层与动作专家采用双时间尺度RL后训练,提升VLA模型在操作任务上的性能,在基准与真实任务中均优于现有方法。
潜在上下文是否有帮助?北极航运中逆强化学习的受控评估
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。
DeepForgeSeal:基于对抗强化学习的隐空间驱动半脆弱深度伪造检测水印技术
机构 * The Signal Processing, Artificial Intelligence and Vision Technologies (SAIVT), Queensland University of Technology, Australia(信号处理、人工智能与视觉技术研究所(SAIVT),昆士兰理工大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 该研究针对深度伪造检测中现有水印方法鲁棒性与脆弱性难以平衡的问题,提出基于对抗强化学习的隐空间驱动半脆弱水印框架,在CelebA和CelebA-HQ数据集上性能优于现有最优方法
Comments Accepted for Publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
ATLAS:基于抽象后继的自适应拓扑学习用于持续学习
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ATLAS算法,通过结构解耦转移动态与奖励信号,在空间导航任务中实现高样本效率、抗灾难性遗忘及对新目标的快速适应,在非平稳环境中性能显著优于基线强化学习算法。
超越动作模仿:仅有人体动作数据是否足以解释步态控制与生物力学?
机构 * Joint Department of Biomedical Engineering, University of North Carolina - Chapel Hill(北卡罗来纳大学教堂山分校联合生物医学工程系) ; Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电气与计算机工程系) ; School of Electrical, Computer and Energy Engineering, Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 本研究探讨了在基于强化学习的动作模仿框架中,加入足-地面相互作用测量对人类步态运动学和运动动力学估计的影响,发现仅准确再现运动学不足以保证生物力学合理性,需引入动力学约束以提升步态表示的物理一致性。
Comments 8 pages, 7 figures
结合增量知识的神经符号推理用于样本高效分层强化学习
机构 * NTU Singapore(新加坡南洋理工大学) ; IPAL, CNRS, France(法国IPAL-CNRS)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出结合增量知识(InK)的神经符号分层强化学习,通过符号高层组件执行符号规划、低层神经模块学习运动原语,在导航任务中显著提升了样本效率,还开发了信念世界树搜索方法。
Comments Published in ECML-PKDD 2026
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
基于值函数的模仿学习中,何时在线交互是有帮助的?表示权衡研究
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 本文针对基于值函数的模仿学习,提出交互式在线算法OVI,发现专家交互可降低学习者的表示要求,且OVI在多数场景下性能优于现有方法。
为实机零样本强化学习的最大熵行为探索
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。
成本受限四足硬件上的强化学习
机构 * Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Stanford University School of Medicine(斯坦福大学医学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 该研究针对低成本四足硬件的仿真-现实差距,采用生物启发方法,结合延迟前向模型与时间感知神经网络,学习到鲁棒CPG,实现了成本受限硬件上的强化学习控制。
Comments Sim-to-real transfer, locomotion, reinforcement learning, central pattern generator
在真实机器人上在线强化学习中什么至关重要
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google DeepMind(谷歌DeepMind)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本研究探讨了在真实机器人上实现稳定在线强化学习的关键设计选择,发现某些默认设置可能有害,而稳健的设计选择能提高学习稳定性。
关系隐藏状态强化学习中作为涌现行为的规划
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG
AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。