arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-03 至 2026-02-03 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 14 篇

2602.02454 2026-02-03 cs.RO cs.AI 86%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01266 2026-02-03 cs.RO 80%

Reinforcement Learning for Active Perception in Autonomous Navigation

自主导航中的主动感知强化学习

Grzegorz Malczyk, Mihir Kulkarni, Kostas Alexis

机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 系,挪威科学技术大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出一种端到端强化学习框架,使无人机在复杂环境中通过主动控制相机实现安全导航与探索。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02396 2026-02-03 cs.RO cs.LG 73%

PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning

PRISM:基于单次传递的RS-IMLE单次传递多感官模仿学习

Amisha Bhaskar, Pratap Tokekar, Stefano Di Cairano, Alexander Schperberg

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 PRISM通过单次传递的RS-IMLE方法,实现高效的多感官模仿学习,优于扩散策略,提升成功率并减少轨迹 jerk。

Comments 10 pages main text and 4 figures, and 11 pages appendix and 10 figures, total 21 pages and 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 73%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07593 2026-02-03 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 67%

Vision-Proprioception Fusion with Mamba2 in End-to-End Reinforcement Learning for Motion Control

基于Mamba2的视觉-本体感知融合在端到端强化学习中的运动控制

Xiaowen Tao, Yinuo Wang, Jinzhao Zhou

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林三一学院计算机科学与统计学系) Faculty of Engineering and Information Technology, University of Technology Sydney(新南威尔士大学理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于SSD-Mamba2的视觉-本体感知融合框架,通过端到端强化学习提升运动控制的效率和安全性。

Comments 6 figures and 8 tables. This paper has been accepted by Advanced Engineering Informatics

Journal ref Advanced Engineering Informatics, vol. 71, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02473 2026-02-03 cs.RO cs.LG 62%

HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos

HumanX: 向通过人类视频实现敏捷且可推广的人形交互技能迈进

Yinhuai Wang, Qihan Zhao, Yuen Fui Lau, Runyi Yu, Hok Wai Tsui, Qifeng Chen, Jingbo Wang, Jiangmiao Pang, Ping Tan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 HumanX通过人类视频实现敏捷且可推广的人形交互技能,无需任务特定奖励,展示出高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 62%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02649 2026-02-03 cs.RO cs.AI 62%

Effective Online 3D Bin Packing with Lookahead Parcels Using Monte Carlo Tree Search

有效在线三维装箱使用蒙特卡洛树搜索和前瞻性包裹

Jiangyi Fang, Bowen Zhou, Haotian Wang, Xin Zhu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education China(高可信软件技术重点实验室(北京大学)) Faculty of Computing, Harbin Institute of Technology, Harbin, China(计算机学院,哈尔滨工业大学,哈尔滨,中国) JD Logistic, Beijing, China(京东物流,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于蒙特卡洛树搜索和前瞻性包裹的在线三维装箱方法,通过动态探索先验平衡强化学习策略与稳健随机策略,有效应对物流中的短期分布变化,实现显著的装箱效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14858 2026-02-03 cs.LG cs.AI 62%

1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities

1000层网络用于自监督强化学习:增加深度可以启用新的目标到达能力

Kevin Wang, Ishaan Javali, Michał Bortkiewicz, Tomasz Trzciński, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Warsaw University of Technology(华沙理工大学) Tooploox IDEAS Research Institute(IDEAS研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增加网络深度至1024层,显著提升自监督强化学习的目标到达能力,实验显示性能提升达2-50倍。

Comments Link to project website: https://wang-kevin3290.github.io/scaling-crl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00401 2026-02-03 cs.RO cs.AI 62%

ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control

ZEST:零样本具身技能迁移用于竞技机器人控制

Jean Pierre Sleiman, He Li, Alphonsus Adu-Bredu, Robin Deits, Arun Kumar, Kevin Bergamin, Mohak Bhardwaj, Scott Biddlestone, Nicola Burger, Matthew A. Estrada, Francesco Iacobelli, Twan Koolen, Alexander Lambert, Erica Lin, M. Eva Mungai, Zach Nobles, Shane Rozen-Levy, Yuyao Shi, Jiashun Wang, Jakob Welner, Fangzhou Yu, Mike Zhang, Alfred Rizzi, Jessica Hodgins, Sylvain Bertrand, Yeuhi Abe, Scott Kuindersma, Farbod Farshidian

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 ZEST通过强化学习从多种数据源训练策略,实现零样本具身技能迁移,使机器人能执行复杂动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02283 2026-02-03 cs.LG stat.ML 57%

Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management

基于选择模型的Q学习用于延迟反馈收益管理

Owen Shen, Patrick Jaillet

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01040 2026-02-03 cs.RO 57%

Learning Adaptive Cross-Embodiment Visuomotor Policy with Contrastive Prompt Orchestration

学习适应性跨主体视觉运动策略与对比提示协调

Yuhang Zhang, Chao Yan, Jiaxi Yu, Jiaping Xiao, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 CAPO通过对比提示学习和自适应提示协调,提升跨主体视觉运动策略的适应性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00452 2026-02-03 cs.LG 57%

Imitation from Observations with Trajectory-Level Generative Embeddings

通过轨迹级生成嵌入进行观察模仿学习

Yongtao Qu, Shangzhe Li, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 TGE通过轨迹级生成嵌入解决离线模仿学习中专家数据稀缺的问题,利用时序扩散模型构建平滑奖励,提升离线数据与专家行为间的学习信号。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10007 2026-02-03 cs.LG math.OC stat.ML 57%

Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning

分布鲁棒平均奖励强化学习的样本复杂度

Zijun Chen, Shengbo Wang, Nian Si

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出两种算法,实现了分布鲁棒平均奖励强化学习的近最优样本复杂度,通过锚定状态稳定转移核并保证收敛性。

Comments Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏