arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 206 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 206 篇

2606.24962 2026-06-25 cs.LG 新提交 57%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24991 2026-06-25 eess.SY cs.LG cs.SY math.OC 新提交 57%

Solving Markov Decision Processes with Future Information via MPC

通过MPC求解具有未来信息的马尔可夫决策过程

Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt, Sebastien Gros

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。

Comments 6 pages, accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24078 2026-06-24 cs.RO 新提交 57%

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning

MinInter:在模仿学习的数据增强中最小化轨迹插值

Qingyang Wang, Xingang Liu, Changwei Yao, Zikai Ouyang, Junwei Liu, Haibo Lu, Wei Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Pengcheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出MinInter方法,通过选择需要最少插值的源演示来生成高质量合成轨迹,在MimicGen基准的12个操作任务中显著提升数据生成成功率和策略成功率。

Comments Accepted by IEEE CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21350 2026-06-23 cs.LG 新提交 57%

A Reward-Petri-Net Interpretation of Temporal Behavior Trees

时间行为树的奖励-佩特里网解释

Till Schmeil, Günther Waxenegger-Wilfing, Sebastian Schirmer

机构 * University of Würzburg(维尔茨堡大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 提出将时间行为树(TBT)转换为奖励-佩特里网(RPN)的方法,自动生成奖励函数,解决复杂长时域机器人任务中强化学习奖励设计难题,提高样本效率和学习可控性。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20871 2026-06-23 cs.RO 新提交 57%

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning

几何熵:轨迹多样性在模仿学习中的利弊

Qian Luo, Ruizhe Liu, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(香港大学信息体人工智能实验室) Transcengram

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出几何熵(H_G)量化演示轨迹的几何多样性,发现成功率与H_G呈倒U型关系,且最优熵随任务掌握度增加而降低,可用于数据集审计与校准。

Comments Accepted to IROS 2026. Project page: https://geometric-entropy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19690 2026-06-19 cs.LG 新提交 57%

Multi-Granular Attention-Driven Reinforcement Learning Framework for Web Intelligent Enhancement Systems

多粒度注意力驱动的强化学习框架用于Web智能增强系统

Navin Chhibber, Deepak Singh, Anokh Kishore, Nikita Chawla, K. Anguraj

机构 * Infinity Tech Group Gainwell Technologies Capital One Sunnyvale, CA, USA(美国硅谷) Department of Electronics and Communication Engineering(电子与通信工程系) Sona College of Technology(Sona科技学院) Independent Researcher(独立研究员) Salem, India(印度塞拉姆)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出MGAR-WIES框架,通过语义图建模、注意力机制和自适应强化学习,解决Web环境中异构动态数据的语义理解与可扩展性问题,在准确率上达到80%。

Comments 2026 3rd International Conference on Integrated Intelligence and Communication Systems (ICIICS), 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18328 2026-06-18 cs.RO 新提交 57%

Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures

恢复、发现、规划:从机器人失败中学习技能与概念

Bowen Li, Mayank Mishra, Y. Isabel Liu, Stone Tao, Nishanth Kumar, Alexander G. Gray, Ruwan Wickramarachchi, Jonathan Francis, Sebastian Scherer, Tom Silver

机构 * CMU(卡内基梅隆大学) Princeton(普林斯顿大学) AI2(艾伦人工智能研究所) MIT(麻省理工学院) Centaur AI Bosch Center for AI(博世人工智能中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出ReSYNC方法,通过技能学习与概念发现的交替过程,从失败恢复经验中逐步构建抽象谓词,实现全局失败避免和长期规划,性能提升超50%。

Comments 9 pages, 6 figures. Website: https://jaraxxus-me.github.io/ReSYNC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16870 2026-06-16 cs.CV cs.GR 新提交 57%

Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation

潜空间强化学习用于食品断裂模拟中的逆材料估计

Adrian Ramlal, Yuhao Chen, John S. Zelek

机构 * University of Waterloo(滑铁卢大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对食品断裂模拟中材料参数难以直接测量的问题,提出基于潜空间强化学习的目标条件策略,实现从断裂行为描述到材料参数的单次前向估计,精度提升23%。

Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 MetaFood Workshop

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 9573-9581

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14415 2026-06-15 cs.AI 新提交 57%

CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning

CSPO: 面向安全强化学习的约束敏感策略优化

Ayoub Belouadah, Sylvain Kubler, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出约束敏感策略优化(CSPO),通过引入局部约束敏感性修正原目标,加速安全恢复并减少振荡,在导航与运动基准上取得更高约束回报。

Comments Accepted as a Spotlight paper at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09009 2026-06-09 cs.CV 新提交 57%

Scaling by Diversified Experience for Vision-Language-Action Models

通过多样化经验扩展视觉-语言-动作模型

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.CV

AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。

Comments ICML 2026, SyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08312 2026-06-09 cs.AI cs.FL 新提交 57%

Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

自回归强化学习策略中LTLf约束的神经符号注入

Ashkan Ansarifard, Matteo Mancanelli, Elena Umili, Fabio Patrizi

机构 * Sapienza University of Rome(罗马大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出神经符号框架,将LTLf约束编译为DFA并通过可微损失注入Transformer策略,在导航任务中提升约束满足且保持回报竞争力。

Comments Accepted at the Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs (SKILLED-LLMs 2026), co-located with KR 2026 and FLoC 2026, Lisbon, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08154 2026-06-09 cs.RO 新提交 57%

SynthICL: Scalable In-context Imitation Learning with Synthetic Data

SynthICL: 基于合成数据的可扩展上下文模仿学习

Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

机构 * The Robot Learning Lab(机器人学习实验室) Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出SynthICL框架,利用纯RGB合成数据训练上下文模仿学习策略,避免深度传感和真实数据,通过子目标预测提升控制精度,在16个真实操作任务中平均成功率79%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08104 2026-06-09 cs.RO 新提交 57%

Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations

线性嵌入空间中的强化学习解锁软体机器人配置的通用控制

Xinglong Zhang, Cong Li, Hangjie Mo, Yue Jiang, Xin Xu, Wei Jiang, Zhenshan Bing, Yihe Yang, Xiaojian Li, Yueneng Yang, Huimin Lu, Ling-li Zeng, Alois Knoll, Dewen Hu, Li Wen, Wei Pan

机构 * National University of Defense Technology(国防科技大学) Hefei University of Technology(合肥工业大学) Nanjing University (Suzhou Campus)(南京大学(苏州校区)) Technical University of Munich(慕尼黑工业大学) Beihang University(北京航空航天大学) Newcastle University(纽卡斯尔大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 提出基于共享线性Koopman嵌入空间的强化学习框架,将控制策略与机器人形态解耦,实现跨33种软体机器人配置的快速迁移,样本量减少75倍,并支持高速运动、重载和多执行器故障下的鲁棒控制。

Comments An updated version of this paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08064 2026-06-09 cs.RO 新提交 57%

Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning

基于多智能体强化学习的协作长绳跳绳

Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Beijing Academy of Artificial Intelligence, BAAI(北京智源人工智能研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出Marope框架,采用分层强化学习实现多个人形机器人的协作长绳跳绳,通过多智能体强化学习训练分散的摇绳策略,上层调度策略协调执行,并融入多样跳跃策略提升泛化能力,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13579 2026-07-16 cs.RO cs.AI cs.LG 新提交 56%

Agile perceptive multi-skill locomotion for quadrupedal robots in the wild

野外四足机器人的敏捷感知多技能运动

Jun-Gill Kang, Jaehyun Park, Tae-Gyu Song, Joon-Ha Kim, Seungwoo Hong, Hae-Won Park

机构 * Agency for Defense Development(国防发展局) Korea Advanced Institute of Science and Technology(韩国科学技术院) DIDEN Robotics(迪登机器人公司) Korea University(韩国大学)

专题命中 模仿学习与强化学习 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 研究使四足机器人在复杂地形实现多技能运动的问题,提出 APT-RL 框架,利用机载感知和计算自主转换技能,通过轨迹优化生成数据集训练技能,经实验验证该框架能让机器人在复杂环境敏捷机动,稳健穿越多样障碍物。

Comments Project page: https://skillquadsr.github.io/ ,This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science Robotics on 7.15.2026; doi: 10.1126/scirobotics.adz7397. Jun-Gill Kang and Jaehyun Park are co-first authors. Seungwoo Hong and Hae-Won Park are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26697 2026-07-30 physics.acc-ph 新提交 50%

Reinforcement Learning applied to Optimization of LHC beams in the CERN Proton Synchrotron

强化学习在欧洲核子中心质子同步加速器(CERN PS)LHC束流优化中的应用

Joel Axel Wulff, Alexandre Lasheen

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本研究将卷积神经网络与Soft-Actor-Critic强化学习智能体结合,实现CERN PS纵向三重分裂的自动化优化,其2025年部署的自主控制器为CERN注入器复合体首批强化学习束流质量优化系统之一。

Comments 15 pages, 14 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22541 2026-07-28 math.OC cs.NA math.NA math.PR 新提交 50%

SDE Guided Monte Carlo Reinforcement Learning: A Stochastic Maximum Principle Approach for Robust Decision Making in Noisy Environments

随机微分方程引导的蒙特卡罗强化学习:一种用于噪声环境中稳健决策的随机最大值原理方法

Juncai Wang

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究探讨SMP定性最优条件能否指导稳健表格型强化学习算法,提出SDE-MC-AC框架,通过建立对应关系及自适应温度调度整合多种方法,经实验验证了相关假设,揭示导航模式,为随机最优控制与强化学习搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 50%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17635 2026-07-21 eess.SY cs.SY 新提交 50%

On Optimal Event-Triggered Distributed Control for Stochastic Multi-Agent Systems via Reinforcement Learning

基于强化学习的随机多智能体系统最优事件触发分布式控制

Ziming Wang, Bingbing Li, Karl H. Johansson, Apostolos I. Rikos

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含随机不确定性的多智能体系统,提出基于强化学习的最优分布式控制算法,采用 actor-critic-identifier 结构,用低通滤波器和混合事件触发控制策略,经稳定性证明,在仿真中验证正确性并与非最优算法比较突出优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10830 2026-07-14 cs.CR 新提交 50%

Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning

基于深度强化学习的数字孪生自动隐身磨损攻击

Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02171 2026-07-03 cond-mat.stat-mech cond-mat.soft 新提交 50%

Theory of collective learning in populations of adaptive agents

自适应智能体群体中的集体学习理论

Gerhard Jung, Johann Asnacios, Misaki Ozawa, Olivier Dauchot, Eric Bertin

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 50%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13891 2026-06-15 eess.SY cs.SY 新提交 50%

TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems

TetraRL:面向设备上深度强化学习系统的自适应运行时

Zexin Li, Soheil Shirvani, Cong Liu

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。

Comments Extension version of RTSS'23 and RTSS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13834 2026-06-15 cs.PF cs.DC cs.SY eess.SY 新提交 50%

Solving Subgraph Extraction Problems Using $Δ$Search

使用$\Delta$Search解决子图提取问题

Rebin Silva Valan Arasu, Rajiv Gupta

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。

Comments 23 pages, 13 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏