arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2603.22273 2026-05-14 cs.LG 57%

Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration

解耦探索与策略优化:基于不确定性引导的树搜索用于困难探索

Zakaria Mhammedi, James Cohan

机构 * Google Research, NYC(谷歌研究,纽约市)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种解耦探索与策略优化的方法,通过树搜索策略和不确定性测量提升探索效率,在困难探索任务中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12831 2026-05-14 cs.LG 57%

Quantifying Potential Observation Missingness in Inverse Reinforcement Learning

量化逆强化学习中的潜在观察缺失程度

Leo Benac, Abhishek Sharma, Alihan Huyuk, Finale Doshi-Velez

机构 * School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文研究逆强化学习中因观察缺失导致的决策偏差问题,提出算法量化行为数据中可能的观察缺失范围,通过合成导航任务、癌症治疗模拟和ICU治疗数据实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12746 2026-05-14 cs.CR cs.AI 57%

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 57%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11697 2026-05-13 cs.RO 57%

Rainbow Deep Q-Learning with Kinematics-Aware Design for Cooperative Delta and 3-RRS Parallel Robot Insertion

彩虹深度Q学习与运动学感知设计用于协作Delta和3-RRS平行机器人插入

Hassen Nigatu, Gaokun Shi, Jituo Li, Wang Jin, Lu Guodong

机构 * Robotics Research Center of Yuyao(余姚机器人研究中心) Robotics Institute of Zhejiang University(浙江大学机器人院) Yuyao Technology Innovation Center(余姚技术创新中心) Department of Electrical and Computer Engineering, University of New Brunswick(新 Brunswick大学电气与计算机工程系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于Rainbow深度Q网络的运动学感知深度强化学习框架,用于Delta并联机器人与3-RRS并联机械臂的协作插孔任务。通过几何设计优化阶段提升运动学性能,实现六自由度可控子空间,并结合形状奖励机制和两阶段课程训练,提高插孔任务的稳定性和可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 57%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00623 2026-05-12 cs.RO 57%

Recovering Hidden Reward in Diffusion-Based Policies

从扩散策略中恢复隐藏奖励

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08104 2026-05-12 cs.LG 57%

Distributional Reinforcement Learning via the Cramér Distance

通过Cramér距离进行分布式强化学习

Vanya Aziz, Ivo Nowak, E. M. T Hendrix

机构 * HAW Hamburg(汉堡应用技术大学) Universidad de Málaga(马拉加大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出C-DSAC算法,通过最小化Cramér距离改进分布式强化学习,实验表明其在高复杂度环境中优于基线SAC和现有分布式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 57%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 57%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01195 2026-05-11 cs.RO 57%

TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies

TAIL-Safe: 无任务依赖的安全监控用于模仿学习策略

Riad Ahmed, Momotaz Begum

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TAIL-Safe,通过构建Lipschitz连续的Q值函数,基于可见性、可识别性和可抓取性等短期任务无关标准,确定模仿学习策略的安全集,利用Nagumo定理启发的恢复机制提升策略安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03201 2026-05-11 cs.LG 57%

SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

SLOPE:基于模型的强化学习中的乐观势能塑造

Yao-Hui Li, Zeyu Wang, Xin Li, Wei Pang, Yingfang Yuan, Zhengkun Chen, Boya Zhang, Riashat Islam, Alex Lamb, Yonggang Zhang

机构 * Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-沃森大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院) Microsoft Research NY(微软研究院纽约分部) Tsinghua University(清华大学) Jilin University(吉林大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 SLOPE通过乐观势能估计构建信息丰富的势能景观,解决稀疏奖励环境下梯度信息不足的问题,提升模型在稀疏、半稀疏和密集奖励任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05791 2026-05-08 cs.LG 57%

A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration

一种适应数据拟合Q迭代的测度论有限样本理论

Manuel Haussmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种统一的理论框架,用于在一般可测Borel空间上分析拟合Q迭代,通过结合测度论概率与Banach空间中的Bellman算子收缩,提供有限样本适应数据性能界,并首次为连续空间中的FQI提供累积路径在线遗憾保证。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05478 2026-05-08 cs.AI 57%

LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

LANTERN:基于大语言模型的神经符号迁移与经验门控推理网络

Mahyar Alinejad, Yue Wang, Amrit Singh Bedi, George Atia

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 LANTERN通过生成自动机、语义聚合和自适应门控方法,实现多源神经符号迁移,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01352 2026-05-05 cs.OS cs.AI cs.DC 57%

VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU

VUDA: 打破CUDA-Vulkan隔离以实现同一GPU上的计算与图形空间共享

Bin Xu, Pengfei Hu, Wenxin Zheng, Jinyu Gu, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 VUDA通过打破CUDA与Vulkan的执行隔离,实现计算与图形任务的空间并行,提升GPU利用率并减少端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01232 2026-05-05 cs.RO 57%

A Principled Approach for Creating High-fidelity Synthetic Demonstrations for Imitation Learning

为模仿学习创建高保真合成演示的原理性方法

Moniruzzaman Akash, Momotaz Begum

机构 * Spot mobile manipulator(Spot移动机械臂)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于动态运动基元的框架,通过保留专家轨迹结构生成多样化演示,实现高保真渲染与几何推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01201 2026-05-05 cs.RO 57%

To Do or Not to Do: Ensuring the Safety of Visuomotor Policies Learned from Demonstrations

做或不做:确保从示范中学习的视觉-运动策略的安全性

Riad Ahmed, Moniruzzaman Akash, Momotaz Begum

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种政策无关的安全度量,确保视觉-运动策略在状态空间特定区域内的最大任务成功率,通过视图合成和Nagumo子切线条件分析,验证了策略安全性和性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00384 2026-05-04 cs.RO 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 57%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04341 2026-05-04 cs.LG 57%

Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism

长周期基于模型的离线强化学习无需显式保守性

Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出NEUBAY算法,通过贝叶斯方法解决长周期rollout中的价值过估计问题,在D4RL和NeoRL基准上取得新进展。

Comments ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28056 2026-05-01 cs.AI 57%

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

RHyVE:基于能力的验证与阶段感知部署用于LLM生成的奖励假说

Feiyu Wu, Xu Zheng, Zhuocheng Wang, Yi ming Dai, Hui Li

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究提出RHyVE框架,通过能力感知验证和阶段感知部署提升LLM生成奖励假说的可靠性,实验显示在低能力阶段奖励排名不可靠,但经过任务依赖阈值后变得有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 57%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11218 2026-04-28 cs.RO 57%

Humanoid Whole-Body Badminton via Multi-Stage Reinforcement Learning

人形机器人多阶段强化学习实现全身体育羽毛球

Chenhao Liu, Leyun Jiang, Yibo Wang, Kairan Yao, Jinchen Fu, Xiaoyu Ren

机构 * Beijing Phybot Technology Co., Ltd(北京 Phybot 技术有限公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出多阶段强化学习框架,实现人形机器人羽毛球全身体术控制,通过三阶段课程学习协调步伐与击球,实验验证在仿真和硬件上均取得高精度击球性能。

Comments Project Page: https://humanoid-badminton.github.io/Humanoid-Whole-Body-Badminton-via-Multi-Stage-Reinforcement-Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23000 2026-04-28 cs.RO 57%

Learning from the Best: Smoothness-Driven Metrics for Data Quality in Imitation Learning

向最佳学习:用于模仿学习中数据质量的平滑驱动度量

Soham Kulkarni, Raayan Dhar, Yuchen Cui

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出RINSE框架,通过轨迹平滑度评估演示数据质量,改进模仿学习中的数据筛选与重加权,实验证明在不同任务中提升性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22081 2026-04-27 cs.LG physics.comp-ph 57%

Insect-inspired modular architectures as inductive biases for reinforcement learning

受昆虫启发的模块化架构作为强化学习的归纳偏差

Anne E. Staples

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出了一种模块化强化学习架构,通过分布式电路实现感知编码、方向表示、稀疏联想记忆等功能,以应对动态竞争的行为目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 57%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17050 2026-04-21 cs.RO 57%

Web-Gewu: A Browser-Based Interactive Playground for Robot Reinforcement Learning

Web-Gewu: 一个基于浏览器的机器人强化学习交互 playground

Kaixuan Chen, Linqi Ye

机构 * School of Future Technology, Shanghai University(上海大学未来技术学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 Web-Gewu 通过 WebRTC 云-边-端架构降低机器人强化学习教育的计算和环境配置门槛,实现低延迟的浏览器端交互和实时可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22149 2026-04-21 cs.CL cs.AI 57%

DynaWeb: Model-Based Reinforcement Learning of Web Agents

DynaWeb:基于模型的Web代理强化学习

Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Hong Kong University of Science and Technology(香港科学与技术大学) McGill University(麦吉尔大学) Shanghai AI Lab(上海人工智能实验室) Gradient University of Toronto(多伦多大学) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出DynaWeb框架,通过模拟环境提升Web代理的强化学习效率,实验表明其在WebArena和WebVoyager基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15772 2026-04-20 cs.RO 57%

Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS)

基于模糊逻辑理论的自适应奖励塑造用于鲁棒强化学习(FARS)

Hürkan Şahin, Van Huyen Dang, Erdi Sayar, Alper Yegenoglu, Erdal Kayacan

机构 * Automatic Control Group (RAT)(自动控制组(RAT))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于模糊逻辑的自适应奖励塑造方法,通过整合人类直觉提升强化学习的稳定性与鲁棒性,在复杂导航任务中实现更平滑的运动与控制过渡。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏