arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-25 至 2026-08-25 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 13 篇

2603.16673 2026-08-25 cs.RO cs.AI cs.LG 版本更新 85%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 模仿学习与强化学习 :robotic(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22027 2026-08-25 cs.RO cs.AI 版本更新 81%

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23452 2026-08-25 cs.RO cs.AI cs.LG 新提交 76%

Reward-Free Continual Adaptation for Resilient Space Robots

面向弹性空间机器人的无奖励持续适应

Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez

机构 * University of Luxembourg(卢森堡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 针对空间机器人硬件退化导致传统控制策略失效的问题,提出无奖励持续学习框架,利用隐态世界模型使智能体无需奖励即可适应环境,在三类模拟任务中验证了方法有效性。

Comments Accepted for publication at the Third Conference on AI in and for Space (SPAICE 2026) | The source code is available at this https URL (https://github.com/AndrejOrsula/space_robotics_bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22591 2026-08-25 cs.RO 新提交 74%

WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning

WorldToken:面向机器人模仿学习的时间优先序列建模

Chunkai Yang, Andong Yang, Chao Gao

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) Tsinghua University(清华大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

AI总结 该研究提出时间优先序列建模方法WorldToken,融合多类观测生成世界token序列,结合因果时间Transformer与扩散动作头,在机器人模仿学习任务上验证了其可行性及数据缩放、时间上下文特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21899 2026-08-25 cs.RO 新提交 70%

CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning

CIDER:面向具身强化学习的持续交互式蒸馏

Houlin Li, Minghui Xu, Guo Xu, Xuan Du, Xiaohan Yan, Chun Wang, Yuxiang Yan, Shukai Yang, Yongcheng Liu, Wei Shan, Maoqing Yao

机构 * AgiBot Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CIDER框架,通过冻结历史策略为教师策略并引入梯度路由,解决具身强化学习的灾难性遗忘问题,在6个现实世界操作任务上实现了新技能获取与旧技能保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14393 2026-08-25 cs.RO cs.AI 版本更新 62%

An offline approach to fNIRS-guided reinforcement learning for robot behavior

一种用于机器人行为的基于fNIRS引导的强化学习的离线方法

Julia Santaniello, Madelaine Brower, Benson Jiang, Donatello Sassaroli, Chenyuan Zhang, Robert Jacob, Jivko Sinapov

专题命中 模仿学习与强化学习 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。

Comments Preliminary results

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04356 2026-08-25 math.OC cs.AI cs.RO 版本更新 62%

Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations

任务对齐的学习引导控制:公式与基础

Vyacheslav Kungurtsev, Alessandro Di Frenna, Gustav Sir, Monicah Cherop Naibei, Haozhe Tian, Homayoun Hamedmoghadam, Akhil Anand, Sebastien Gros

机构 * Czech Technical University in Prague(捷克布拉格工业大学) Norwegian University of Science and Technology(挪威科技大学) Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种任务对齐的学习引导控制框架,结合控制、经典规划和强化学习,提升自主系统安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23204 2026-08-25 cs.RO 新提交 57%

Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

引导式黎曼优化(GuRO):连接模型预测控制与决策Transformer

Hossein Abdi, Satya Prakash Dash, Mingfei Sun

机构 * The University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本研究提出GuRO框架,将MPC与RL整合到序列决策框架,利用黎曼优化解决非凸损失问题,在四足机器人控制任务上优于TRPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22976 2026-08-25 cs.RO 新提交 57%

Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL

特权评论者训练实现端到端强化学习中无传感器推进器故障自适应

Ricard Marsal I Castan, Miguel A. Olivares-Méndez

机构 * University of Luxembourg(卢森堡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 该研究提出RAFT策略,通过特权评论者训练实现无传感器推进器故障自适应,在浮动平台机器人多推进器故障场景下大幅提升容错导航成功率,缩小与神谕策略的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22629 2026-08-25 cs.RO eess.SY 新提交 57%

Enhancing Sim2Real Transfer for Torque-Controlled Robots through Real2Sim Dynamics Estimation and Reinforcement Learning

通过Real2Sim动力学估计与强化学习增强力矩控制机器人的Sim2Real迁移

Davide Bargellini, Alex Pasquali, Andrea Govoni, Riccardo Zanella, Gianluca Palli

机构 * University of Bologna(博洛尼亚大学) University of Twente(特文特大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本研究提出Real2Sim2Real流水线,结合轨迹匹配等方法校准7自由度Franka Emika Panda机器人动力学,训练TQC智能体,实现力矩控制机器人Sim2Real迁移,提升了跟踪精度与鲁棒性。

Comments 6 pages, 8 figures. Presented at the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21740 2026-08-25 cs.RO 新提交 57%

CounterAlign: Counterfactual Supervision for Vision-Language-Action Models

CounterAlign:面向视觉-语言-动作模型的反事实监督

Haru Kondoh, Kei Ota, Asako Kanezaki, Yueh-Hua Wu

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 该研究提出CounterAlign方法,通过指令重标记从专家演示合成反事实元组,结合对抗判别器训练学习奖励模型,提升VLA模型在LIBERO-PRO基准及TX-G2机器人实验中的鲁棒性与性能。

Comments Project page: this https URL (https://counteralign.airoa.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-08-25 cs.RO 版本更新 57%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 57%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏