arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-31 至 2026-08-31 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2608.09467 2026-08-31 cs.CV cs.AI 版本更新 81%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27508 2026-08-31 cs.AI 新提交 79%

WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

WM-R1:用强化学习训练GUI智能体以推理并利用世界模型

Yu Han, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 该研究提出首个用世界模型替代真实环境训练GUI智能体的强化学习框架WM-R1,在Android基准测试中其性能显著优于仅GRPO的基线方法和推理时模拟方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-31 cs.RO cs.CV 版本更新 62%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures. v2: updated Funding section

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28140 2026-08-31 cs.RO 新提交 61%

Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL

基于多评论家强化学习的非抓取型移动操纵的接触引导探索

Simone Tolomei, Mayank Mittal, Franco Angelini, Manolo Garabini, Paolo Salaris, Marco Hutter

机构 * Centro di Ricerca E. Piaggio(E.皮亚焦研究中心) Università di Pisa(比萨大学) ETH Zürich(苏黎世联邦理工学院) NVIDIA(英伟达公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 针对非抓取型移动操纵的复杂混合动力学与接触稀疏性问题,提出多评论家RL框架下的接触引导探索策略,经四足移动操纵器实验验证可实现现实世界中的非抓取型操纵。

Comments project website: this https URL (https://tolomeis.github.io/contact-guided-exp) Accepted in IEEE Robotics and Automation Letter (RA-L) 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28065 2026-08-31 cs.AI 新提交 57%

Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning

基于离线模型强化学习的激励式广告激励分配学习

Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance(字节跳动) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本研究针对激励式广告的序列激励分配问题,提出离线模型强化学习框架,实验显示MB-IQL可显著提升人均净利润,验证了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏