arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-26 至 2026-08-26 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 7 篇

2605.02867 2026-08-26 cs.LG cs.AI cs.RO 版本更新 82%

Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters

通过SHAP分析算法和超参数增强机器人学中强化学习的泛化能力

Lingxiao Kong, Cong Yang, Oya Deniz Beyan, Zeyd Boukhers

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) University of Cologne(科隆大学) University Hospital of Cologne(科隆大学医院)

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出基于SHAP的可解释框架,量化算法和超参数对强化学习泛化差距的贡献,并用于配置选择以提升泛化能力。

Comments Accepted by International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22027 2026-08-26 cs.RO cs.AI 版本更新 81%

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23831 2026-08-26 cs.RO cs.LG 新提交 62%

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu (1), Momen Khalil (1), E Harrison (2), Emanuele Poggi (1), Philipp Schmitt (1), Bernd Kast (1), Philine Meister (1), Pranav Atreya (2), Qiyang Li (2), Finn Ferchau (1), Cesar Colmenero (1), Yash Shahapurkar (1), Gokul Narayanan (1), Melih Erdogan (1), Kai Wurm (1), Georg von Wichert (1), Oier Mees (3 and 4 and 2), Eugen Solowjow (1), Andrew Wagenmaker (2), Sergey Levine (2) ((1) Siemens (2) UC Berkeley (3) Microsoft (4) ETH Zurich)

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19969 2026-08-26 cs.RO cs.LG 版本更新 62%

E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning

E2HiL: 基于熵引导的高效真实世界人机协同强化学习样本选择

Haoyuan Deng, Yudong Lin, Yuanjiang Xue, Haoyang Du, Qianzhun Wang, Boyang Zhou, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 E2HiL通过熵引导的样本选择方法,提高了真实世界人机协同强化学习的样本效率和成功率,减少了人工干预需求。

Comments Project page: this https URL (https://e2hil.github.io/) Updated to the final IEEE RA-L version. The author list has been revised to match the published version, adding Yudong Lin and Qianzhun Wang. Main results and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00610 2026-08-26 cs.RO 版本更新 61%

Vision-based Goal-Reaching Control for Mobile Robots Using a Hierarchical Learning Framework

基于视觉的目标到达控制的移动机器人Hierarchical Learning框架

Mehdi Heydari Shahna, Pauli Mustalahti, Jouni Mattila

机构 * Faculty of Engineering and Natural Sciences, Tampere University(工程与自然科学学院,塔尔皮莱大学)

专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出一种基于视觉的目标到达控制框架,通过分层学习方法提高移动机器人在复杂地形中的安全性和稳定性。

Comments Published in Robotics and Autonomous Systems, Volume 206, Article 105710

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24479 2026-08-26 cs.LG 新提交 57%

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

WarpSAC:通过重新思考探索与利用,迈向可拓展离线强化学习的顶峰

Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li, Yifu Yuan, Fei Ni, Jinyi Liu, Wei Wei, Jianrong Wang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学) Shanxi University(山西大学) Imperial College London(伦敦帝国学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 该研究针对大规模并行模拟下离线RL的数据 regime 变化问题,提出具 regime 感知的WarpSAC算法家族,适配不同数据规模场景,在多基准任务及现实部署上较FlashSAC实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23204 2026-08-26 cs.RO 版本更新 57%

Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

引导式黎曼优化(GuRO):连接模型预测控制与决策Transformer

Hossein Abdi, Satya Prakash Dash, Mingfei Sun

机构 * The University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本研究提出GuRO框架,将MPC与RL整合到序列决策框架,利用黎曼优化解决非凸损失问题,在四足机器人控制任务上优于TRPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏