arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4126 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4126 篇

2502.13406 2026-03-09 cs.RO cs.AI cs.SY eess.SY 62%

Generative Predictive Control: Flow Matching Policies for Dynamic and Difficult-to-Demonstrate Tasks

生成预测控制:用于动态和难以示范任务的流匹配策略

Vince Kurtz, Joel W. Burdick

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出生成预测控制方法,用于解决动态且难以示范任务中的快速动态问题,通过流匹配策略实现高效反馈和高频率控制。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04790 2026-03-06 cs.LG cs.RO 62%

Diffusion Policy through Conditional Proximal Policy Optimization

通过条件近端策略优化实现扩散策略

Ben Liu, Shunpeng Yang, Hua Chen

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03973 2026-03-06 cs.LG cs.AI 62%

Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning

引导流策略:在离线强化学习中学习高价值动作

Franki Nguimatsia Tiofack, Théotime Le Hellard, Fabian Schramm, Nicolas Perrin-Gilbert, Justin Carpentier

机构 * Inria and DI-ENS, PSL Research University(Inria和DI-ENS,PSL研究大学) Sorbonne Université, CNRS, ISIR, France(索邦大学,CNRS,ISIR,法国)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 引导流策略通过结合多步流匹配与提炼的演员,有效区分高价值动作,从而在多个基准测试中实现卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04289 2026-03-05 cs.LG cs.AI 62%

IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning

IPD: 通过离线规划蒸馏提升序列策略

Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 IPD通过引入离线规划蒸馏技术,提升离线强化学习中序列策略的决策稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18817 2026-03-04 cs.RO cs.LG 62%

Learning Acrobatic Flight from Preferences

从偏好学习空中杂技飞行

Colin Merk, Ismail Geles, Jiaxu Xing, Angel Romero, Giorgia Ramponi, Davide Scaramuzza

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出REC框架,通过基于置信度的奖励集合方法,在空中杂技飞行中实现88.4%的奖励性能,优于传统方法的55.2%,并验证其在连续控制中的广泛适用性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14696 2026-03-03 cs.CV cs.GR cs.RO 62%

CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives

CRISP: 从单目视频中基于接触引导的现实到仿真转换

Zihan Wang, Jiashun Wang, Jeff Tan, Yiwen Zhao, Jessica Hodgins, Shubham Tulsiani, Deva Ramanan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 CRISP通过拟合平面原始体和强化学习,从单目视频中生成可模拟的现实到仿真环境,显著降低运动跟踪失败率。

Comments Published at ICLR 2026. Project page: https://crisp-real2sim.github.io/CRISP-Real2Sim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21533 2026-03-03 cs.RO cs.AI 62%

Model Predictive Adversarial Imitation Learning for Planning from Observation

基于模型预测的对抗模仿学习用于从观察中规划

Tyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo, Anubhav Vishwakarma, Emily Kang, Sanghun Jung, Rosario Scalise, Jason Zhou, Bryan Xu, Byron Boots

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09434 2026-03-03 cs.MA cs.AI cs.LG 62%

When Is Diversity Rewarded in Cooperative Multi-Agent Learning?

在合作多智能体学习中,多样性何时会被奖励?

Michael Amir, Matteo Bettini, Amanda Prorok

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 研究通过理论分析和算法验证,探讨了多智能体学习中异质性团队奖励机制,提出HetGPS算法用于发现异质性优势的奖励场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00396 2026-03-03 cs.LG cs.AI cs.SY eess.SY math.OC 62%

Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries

继承性几何元强化学习:通过任务对称性实现非局部泛化

Paul Nitschke, Shahriar Talebi

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出继承性几何元强化学习方法,通过任务对称性实现非局部泛化,提升任务空间泛化能力。

Comments Accepted to 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09469 2026-02-24 cs.MA cs.AI cs.RO 62%

Towards Information-Optimized Multi-Agent Path Finding: A Hybrid Framework with Reduced Inter-Agent Information Sharing

迈向信息优化的多智能体路径寻找:一种减少智能体间信息共享的混合框架

Bharath Muppasani, Ritirupa Dey, Biplav Srivastava, Vignesh Narayanan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种减少智能体间信息共享的混合框架IO-MAPF,通过强化学习和轻量级集中协调器实现高效多智能体路径寻找,在信息受限条件下保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18694 2026-02-24 cs.LG cs.AI 62%

In-Context Planning with Latent Temporal Abstractions

基于潜在时间抽象的上下文规划

Baiting Luo, Yunuo Zhang, Nathaniel S. Keplinger, Samir Gupta, Abhishek Dubey, Ayan Mukhopadhyay

机构 * Vanderbilt University(范德比大学) William & Mary(威廉与玛丽学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 I-TAP通过学习离散时间抽象空间,实现高效且鲁棒的上下文规划,在部分可观测和随机动态环境中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18097 2026-02-23 cs.RO cs.LG 62%

Interacting safely with cyclists using Hamilton-Jacobi reachability and reinforcement learning

与骑行者安全交互的框架:利用哈密顿-雅可比可达性分析与强化学习

Aarati Andrea Noronha, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出结合哈密顿-雅可比可达性分析与深度Q学习的框架,用于实现自动驾驶车辆与骑行者的安全高效交互。

Comments 7 pages. This manuscript was completed in 2020 as part of the first author's graduate thesis at Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18025 2026-02-23 cs.AI cs.RO 62%

Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets

跨体态离线强化学习用于异构机器人数据集

Haruki Abe, Takayuki Osa, Yusuke Mukuta, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进情报项目中心)

专题命中 模仿学习与强化学习 :robot policy(abstract);分类 cs.RO、cs.AI

AI总结 本文提出跨体态离线强化学习方法,通过整合离线强化学习与跨体态学习,提升异构机器人数据集的预训练效果,有效解决次优数据带来的冲突问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17978 2026-02-23 cs.LG cs.AI 62%

Learning Optimal and Sample-Efficient Decision Policies with Guarantees

学习具有保证的最优和样本高效的决策策略

Daqian Shao

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种样本高效且具有保证的学习方法,用于在存在隐藏混杂因素的情况下学习最优决策策略,并通过实验验证了其在现实决策中的有效性。

Comments A thesis submitted for the degree of DPhil in Computer Science at Oxford

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 62%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16196 2026-02-19 cs.LG cs.AI cs.MA 62%

Graphon Mean-Field Subsampling for Cooperative Heterogeneous Multi-Agent Reinforcement Learning

图论均值场子采样用于协作异质多智能体强化学习

Emile Anand, Richard Hoffmann, Sarah Liaw, Adam Wierman

机构 * California Institute of Technology(加州理工学院) Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 GMFS通过子采样异质智能体交互,实现可扩展的协作多智能体强化学习,具有poly(κ)样本复杂度和O(1/√κ)最优性差距。

Comments 43 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15010 2026-02-19 cs.RO cs.LG 62%

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习

Max Sobol Mark, Jacky Liang, Maria Attarian, Chuyuan Fu, Debidatta Dwibedi, Dhruv Shah, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16641 2026-02-18 quant-ph cs.AI cs.LG 62%

Hybrid Reward-Driven Reinforcement Learning for Efficient Quantum Circuit Synthesis

混合奖励驱动强化学习用于高效量子电路综合

Sara Giordano, Kornikar Sen, Miguel A. Martin-Delgado

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合奖励驱动强化学习方法,用于高效合成量子电路,通过结合静态奖励和动态惩罚,优化电路深度和门数,提升量子电路综合效率。

Comments 35 pages, 7 figures, color figures

Journal ref Quantum Mach. Intell. 8, 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20326 2026-02-17 cs.RO cs.AI 62%

Deep Reinforcement Learning based Autonomous Decision-Making for Cooperative UAVs: A Search and Rescue Real World Application

基于深度强化学习的自主决策合作无人机:一种搜索与救援现实应用

Thomas Hickling, Maxwell Hogan, Abdulla Tammam, Nabil Aouf

机构 * School of Science(科学学院) Technology City St George's University of London London, United Kingdom(圣乔治伦敦大学技术学院伦敦英国)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于深度强化学习的自主决策框架,用于室内搜索与救援任务,通过APF奖励和图注意力网络实现高效任务分配与导航,实现实时厘米级稳定性,取得竞赛第一名。

Comments 22 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14587 2026-02-17 cs.LG cs.AI math.OC math.ST stat.TH 62%

Decoupled Continuous-Time Reinforcement Learning via Hamiltonian Flow

通过哈密顿流实现解耦的连续时间强化学习

Minh Nguyen

机构 * Google(谷歌) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解耦的连续时间强化学习算法,通过哈密顿流更新价值函数,并利用扩散生成器学习优势率函数,实现了在连续控制任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO 62%

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 62%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11524 2026-02-13 cs.LG cs.AI cs.CL 62%

Adaptive Milestone Reward for GUI Agents

自适应里程碑奖励用于GUI代理

Congmin Zheng, Xiaoyun Mo, Xinbei Ma, Qiqiang Lin, Yin Zhao, Jiachen Zhu, Xingyu Lou, Jun Wang, Zhaoxiang Wang, Weiwen Liu, Zhuosheng Zhang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ADMIRE通过自适应里程碑奖励机制,解决长周期任务中奖励保真度与密度的矛盾,提升GUI代理的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12314 2026-02-13 cs.LG cs.AI cs.CE cs.CR 62%

Thought Purity: A Defense Framework For Chain-of-Thought Attack

思维纯洁性:针对思维链攻击的防御框架

Zihao Xue, Zhen Bi, Long Ma, Zhenlin Hu, Yan Wang, Xueshu Chen, Zhenfang Liu, Kang Zhao, Jie Xiao, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TP框架,通过整合安全数据管道与强化学习,有效防御思维链攻击,同时保持模型在良性任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08244 2026-02-10 cs.LG cs.AI 62%

Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers

在情境中学习,由选择引导:一种无奖励的强化学习与Transformer的范式

Juncheng Dong, Bowen He, Moyang Guo, Ethan X. Fang, Zhuoran Yang, Vahid Tarokh

机构 * Department of Electrical and Computer Engineering, Duke University, Durham, US(电子工程系,杜克大学,达勒姆,美国) Department of Computer Science, Duke University, Durham, US(计算机科学系,杜克大学,达勒姆,美国) Department of Biostatistics and Bioinformatics, Duke University, Durham, US(生物统计学与生物信息学系,杜克大学,达勒姆,美国) Department of Statistics and Data Science, Yale University, New Haven, US(统计学与数据科学系,耶鲁大学,纽 Haven,美国)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPRL范式,通过仅使用偏好反馈实现无奖励的强化学习,适用于奖励难以获取的场景,实验显示其在连续控制等任务中性能接近传统ICRL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 62%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01299 2026-02-09 cs.AI cs.LG 62%

Scalable In-Context Q-Learning

可扩展的上下文Q学习

Jinmei Liu, Fuhong Liu, Zhenhong Sun, Jianye Hao, Huaxiong Li, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Tianjin University(天津大学) University of Technology Sydney(悉尼大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出S-ICQL框架,通过动态规划和世界建模实现高效的奖励最大化和任务泛化,适用于决策领域。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03493 2026-02-06 cs.LG cs.AI 62%

On Entropy Control in LLM-RL Algorithms

在LLM-RL算法中的熵控制

Han Shen

机构 * Ant Group(蚂蚁集团)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEnt方法,通过改进的熵控制策略提升LLM-RL算法在数学推理任务中的性能。

Comments Updated with ICLR 2026 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02594 2026-02-06 cs.LG cs.AI cs.SE 62%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏