arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-29 至 2026-01-29 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 3 篇

2510.12312 2026-01-29 cs.LG cs.AI 81%

Deep SPI: Safe Policy Improvement via World Models

深度SPI:通过世界模型实现安全策略改进

Florent Delgrange, Raphael Avalos, Willem Röpke

机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) Cohere

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 DeepSPI通过结合世界模型和表示学习,提出了一种在线策略改进算法,在保持理论保证的同时在ALE-57基准中表现优异。

Comments ICLR 2026, 10 pages main text, 21 pages appendix (excluding references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20701 2026-01-29 cs.RO 70%

One Step Is Enough: Dispersive MeanFlow Policy Optimization

一步即可:分散均流策略优化

Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian, Yuhang Wang, Weibing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(大数据分析与处理广东省重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 DMPO通过单步生成、分散正则化和强化学习微调,在实时机器人控制中实现高效动作生成,性能超越多步基线。

Comments Code and project page: https://guowei-zou.github.io/dmpo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19969 2026-01-29 cs.RO cs.LG 62%

E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning

E2HiL: 基于熵引导的高效真实世界人机协同强化学习样本选择

Haoyuan Deng, Yuanjiang Xue, Haoyang Du, Boyang Zhou, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 E2HiL通过熵引导的样本选择方法,提高了真实世界人机协同强化学习的样本效率和成功率,减少了人工干预需求。

Comments Project page: https://e2hil.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏