arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2601.00309 2026-01-05 cs.LG cs.SY eess.SY 57%

Can Optimal Transport Improve Federated Inverse Reinforcement Learning?

最优传输能否改进联邦逆强化学习?

David Millard, Ali Baheri

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出基于最优传输的联邦逆强化学习方法,通过Wasserstein均值融合提升跨异构环境的奖励估计一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24532 2026-01-01 cs.AI cs.CL 57%

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

从积木到规划:通过强化学习在LLMs中实现多步骤空间推理

Amir Tahmasbi, Sadegh Majidi, Kazem Taram, Aniket Bera

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22860 2025-12-30 cs.CR cs.LG cs.MA 57%

Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks

区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击

Soham Padia, Dhananjay Vaidya, Ramchandra Mangrulkar

机构 * Artificial Intelligence Northeastern University(人工智能东北大学) Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。

Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 57%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18850 2025-12-30 cs.RO 57%

InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement

InDRiVE: 通过潜在分歧进行无奖励世界模型预训练以实现自动驾驶

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学-迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 InDRiVE通过潜在分歧进行无奖励世界模型预训练,提升了自动驾驶在零样本迁移和少量样本适应中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 57%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18670 2025-12-23 cs.LG 57%

Demonstration-Guided Continual Reinforcement Learning in Dynamic Environments

动态环境中的演示引导持续强化学习

Xue Yang, Michael Schukat, Junlin Lu, Patrick Mannion, Karl Mason, Enda Howley

机构 * School of Computer Science, University of Galway(Galway大学计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本研究提出演示引导持续强化学习(DGCRL),通过外部演示库指导智能体探索与适应,提升动态环境中的学习效率和知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 57%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16787 2025-12-19 cs.AI 57%

Enter the Void - Planning to Seek Entropy When Reward is Scarce

进入虚无 - 在奖励稀缺时规划以寻求熵

Ashish Sundar, Chunbo Luo, Xiaoyang Wang

机构 * Department of Computer Science University of Exeter(计算机科学系埃克塞特大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出了一种基于世界模型的分层规划方法,在奖励稀缺时主动寻找信息丰富的状态,提升样本效率,应用于Dreamer时在迷宫任务中效率提升50%。

Comments 10 pages without appendix, 15 Figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07342 2025-12-17 cs.CR cs.LG 57%

PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning

PrivORL: 用于离线强化学习的差分隐私合成数据集

Chen Gong, Zheng Liu, Kecen Li, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 PrivORL通过差分隐私技术合成离线强化学习数据集,利用扩散模型和好奇心驱动预训练提升合成数据的多样性和保真度。

Comments Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 57%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12855 2025-12-16 cs.RO cs.SY eess.SY 57%

MPC-Guided Safe Reinforcement Learning and Lipschitz-Based Filtering for Structured Nonlinear Systems

MPC引导的安全强化学习与基于Lipschitz的过滤用于结构非线性系统

Patrick Kostelac, Xuerui Wang, Anahita Jamshidnejad

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出结合MPC与RL的框架,通过安全控制边界和Lipschitz过滤器实现结构非线性系统的安全可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00811 2025-12-15 cs.LG 57%

Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games

均衡策略泛化:一种用于追捕-躲避游戏跨图零样本泛化的强化学习框架

Runyu Lu, Peng Zhang, Ruochuan Shi, Yuanheng Zhu, Dongbin Zhao, Yang Liu, Dong Wang, Cesare Alippi

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学) Università della Svizzera italiana(瑞士意大利大学) Politecnico di Milano(米兰理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出EPG框架,通过均衡策略训练实现追捕-躲避游戏中跨图零样本泛化的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10284 2025-12-15 cs.RO cs.HC 57%

From "Thumbs Up" to "10 out of 10": Reconsidering Scalar Feedback in Interactive Reinforcement Learning

从' thumbs up '到' 10 分之 10 ':重新考虑交互强化学习中的标量反馈

Hang Yu, Reuben M. Aronson, Katherine H. Allen, Elaine Schaertl Short

机构 * Tufts University School of Engineering, Computer Science(塔夫茨大学工程学院计算机科学系) Tufts University School of Engineering, Mechanical Engineering(塔夫茨大学工程学院机械工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出STEADY方法,通过处理标量反馈提升机器人抓取任务中的学习效果,证明标量反馈在适当处理下对强化学习有益。

Journal ref IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06250 2025-12-09 cs.LG 57%

Learning When to Switch: Adaptive Policy Selection via Reinforcement Learning

学习何时切换:通过强化学习实现自适应策略选择

Chris Tava

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05953 2025-12-08 cs.RO 57%

Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning

基于对应关系的模仿学习:具有3D条件的灵活视觉-运动控制

Yunhao Cao, Zubin Bhaumik, Jessie Jia, Xingyi He, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 COIL是一种基于对应关系的模仿学习框架,通过灵活的3D条件策略实现视觉-运动控制,能够适应不同任务需求并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03707 2025-12-04 cs.RO 57%

ContactRL: Safe Reinforcement Learning based Motion Planning for Contact based Human Robot Collaboration

ContactRL: 基于接触的人机协作中的安全强化学习运动规划

Sundas Rafat Mulkana, Ronyu Yu, Tanaya Guha, Emma Li

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ContactRL通过力反馈强化学习实现安全高效的物理协作,提升人机协作任务的安全性和效率。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15607 2025-12-02 cs.RO 57%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01228 2025-12-02 cs.LG 57%

On the Tension Between Optimality and Adversarial Robustness in Policy Optimization

在策略优化中最优性与对抗鲁棒性之间的张力

Haoran Li, Jiayu Lv, Congying Han, Zicheng Zhang, Anqi Li, Yan Liu, Tiande Guo, Nan Jiang

机构 * School of Mathematical Sciences University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Mathematical Sciences Nankai University(南开大学数学科学学院) School of Statistics and Data Science Nankai University(南开大学统计与数据科学学院) Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出 BARPO 框架,通过调节对手强度统一 SPO 和 ARPO,解决策略优化中最优性与对抗鲁棒性之间的张力问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01066 2025-12-02 cs.RO cs.SY eess.SY 57%

Reinforcement Learning for Gliding Projectile Guidance and Control

基于强化学习的滑翔弹体引导与控制

Joel Cahn, Antonin Thomas, Philippe Pastor

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出利用强化学习提升滑翔弹体在动态环境中的自主导航与高精度目标跟踪能力。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22969 2025-12-02 cs.AI cs.MA 57%

Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner

多智能体条件扩散模型与均场通信作为无线资源分配规划器

Kechen Meng, Sinuo Zhang, Rongpeng Li, Xiangming Meng, Yansha Deng, Chan Wang, Ming Lei, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 57%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21011 2025-11-27 cs.LG 57%

Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning

staggered 环境重置提升大规模并行 on-policy 强化学习

Sid Bharthulwar, Stone Tao, Hao Su

机构 * Harvard University(哈佛大学) UC San Diego(圣迭戈大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20018 2025-11-26 cs.NE cs.AI 57%

Energy Costs and Neural Complexity Evolution in Changing Environments

能量成本与神经复杂性在变化环境中的演变

Sian Heesom-Green, Jonathan Shock, Geoff Nitschke

机构 * University of Cape Town(开普敦大学) INRS Montreal(蒙特利尔INRS) NiTheCS

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 本研究通过演进人工神经网络探讨环境变化和能量成本如何影响神经复杂性进化,发现高季节性环境限制大脑大小,支持昂贵大脑假说。

Comments Presented at ALIFE 2025, proceedings forthcoming (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19217 2025-11-25 cs.CV 57%

ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment

ReAlign:通过步感知奖励引导对齐实现文本到动作生成

Wanjiang Weng, Xiaofeng Tan, Junbo Wang, Guo-Sen Xie, Pan Zhou, Hongsong Wang

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 ReAlign通过步感知奖励模型和引导策略提升文本到动作生成的对齐和质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18243 2025-11-25 cs.RO 57%

Dreaming Falcon: Physics-Informed Model-Based Reinforcement Learning for Quadcopters

梦之鹰:用于四旋翼的物理引导模型基强化学习

Eashan Vytla, Bhavanishankar Kalavakolanu, Andrew Perrault, Matthew McCrink

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出一种基于物理引导的世界模型方法,用于改进四旋翼的强化学习性能,通过物理模型预测力矩和状态展开,提升动态环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15046 2025-11-25 cs.AI 57%

Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision

基于文本的决策代理:从自然语言监督中进行离线元强化学习

Shilin Zhang, Zican Hu, Wenhao Wu, Xinyi Xie, Jianxiang Tang, Chunlin Chen, Daoyi Dong, Yu Cheng, Zhenhong Sun, Zhi Wang

机构 * Nanjing University(南京大学) University of Technology Sydney(悉尼大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学) University of New South Wales(新南威尔士大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出T2DA,通过自然语言监督实现离线元强化学习,利用文本-决策预训练提升零样本泛化能力。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16602 2025-11-21 cs.AI 57%

Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization

通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Yingji Zhang, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Haozhe Shan, Junbo Qi, Yan Bai, Dengjie Li, Jiachen Luo, Yidong Wang, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * X-Humanoid Imperial College London(帝国理工学院) Peking University(北京大学) University of Manchester(曼彻斯特大学) Westlake University(西湖大学) Fudan University(复旦大学) Waseda University(早稻田大学) Nvidia Queen Mary University of London(伦敦大学玛丽女王学院) Celonis AI Meta AI

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16108 2025-11-21 cs.AI 57%

SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent

SkyRL-Agent: 多轮长周期LLM代理高效强化学习训练

Shiyi Cao, Dacheng Li, Fangzhou Zhao, Shuo Yuan, Sumanth R. Hegde, Connor Chen, Charlie Ruan, Tyler Griggs, Shu Liu, Eric Tang, Richard Liaw, Philipp Moritz, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * NovaSky AI UC Berkeley(加州大学伯克利分校) Anyscale

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 SkyRL-Agent通过高效异步调度和工具增强训练配方,实现多轮长周期LLM代理的高效强化学习训练,使SA-SWE-32B在SWE-Bench上达到39.4% Pass@1,成本降低超2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14330 2025-11-19 cs.RO 57%

MA-SLAM: Active SLAM in Large-Scale Unknown Environment using Map Aware Deep Reinforcement Learning

Yizhen Yin, Yuhua Qi, Dapeng Feng, Hongbo Chen, Hongjun Ma, Jin Wu, Yi Jiang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏