arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2602.08566 2026-07-01 cond-mat.soft cond-mat.stat-mech 版本更新 50%

Homing through Reinforcement Learning

通过强化学习实现归巢

Riya Singh, Pratikshya Jena, Anish Kumar, Shradha Mishra

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01849 2026-06-26 cs.CL 版本更新 50%

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13891 2026-06-15 eess.SY cs.SY 新提交 50%

TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems

TetraRL:面向设备上深度强化学习系统的自适应运行时

Zexin Li, Soheil Shirvani, Cong Liu

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。

Comments Extension version of RTSS'23 and RTSS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13834 2026-06-15 cs.PF cs.DC cs.SY eess.SY 新提交 50%

Solving Subgraph Extraction Problems Using $Δ$Search

使用$\Delta$Search解决子图提取问题

Rebin Silva Valan Arasu, Rajiv Gupta

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。

Comments 23 pages, 13 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25531 2026-06-09 eess.SP 版本更新 50%

From Denoising to Decision Making: A Survey on Diffusion Model-Enabled Deep Reinforcement Learning for Wireless Networks

从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述

Nguyen Cong Luong, Zeping Sui, Jie Cao, Min Xu, Nguyen Duc Hai, Zhihao Dong, Nguyen Duc Duy Anh, Qiushi Zhao, Nguyen Quoc Khanh, Zhe Fu, Shaohan Feng, Bo Ma

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。

Comments 22 pages, 7 figures, Author list corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08719 2026-06-04 eess.SY cs.SY 50%

Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing

基于深度强化学习的六自由度行星powered着陆与着陆

Brian Gaudet, Richard Linares, Roberto Furfaro

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文提出了一种新型的集成引导与控制算法,利用强化学习原理学习策略,以实现精确且燃料高效的轨迹,同时通过不同的折扣率提升优化性能。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.06491 2026-06-04 eess.SY cs.SY stat.ML 50%

Data-Efficient Reinforcement Learning with Probabilistic Model Predictive Control

基于概率模型预测控制的数据高效强化学习

Sanket Kamthe, Marc Peter Deisenroth

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出基于概率模型预测控制的强化学习框架,通过高斯过程学习转移模型以处理约束,实现数据高效和最优控制。

Comments Accepted at AISTATS 2018,

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.02441 2026-06-04 eess.SY cs.SY stat.ML 50%

A Novel Model for Arbitration between Planning and Habitual Control Systems

一种用于规划与习惯控制系统的仲裁新模型

Farzaneh S. Fard, Thomas P. Trappenberg

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出一种结合规划与习惯控制的仲裁模型,通过模拟双关节机械臂任务展示其在动态环境中的高效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09055 2026-06-04 eess.SY cs.SY 50%

Simultaneous active parameter estimation and control using sampling-based Bayesian reinforcement learning

基于采样式贝叶斯强化学习的同时主动参数估计与控制

Patrick Slade, Preston Culbertson, Zachary Sunberg, Mykel Kochenderfer

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本文提出利用蒙特卡洛树搜索和扩展卡尔曼滤波处理高斯过程噪声和参数不确定性,实现机器人任务中的同时估计与控制,通过比较确定性等价模型预测控制的仿真结果验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.07279 2026-06-04 eess.SY cs.SY 50%

Myopic Policy Bounds for Information Acquisition POMDPs

短视策略界限用于信息获取POMDPs

Mikko Lauri, Nikolay Atanasov, George J. Pappas, Risto Ritala

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文研究了机器人传感系统在环境监测、搜索救援和侦察等场景中的自主信息采集问题,通过部分可观测马尔可夫决策过程(POMDP)建模,提出基于短视计算的策略上下界方法,用于加速最优策略的求解。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.3038 2026-06-04 eess.SY cs.SY 50%

Model-based Path Integral Stochastic Control: A Bayesian Nonparametric Approach

基于模型的路径积分随机控制:一种贝叶斯非参数方法

Yunpeng Pan, Evangelos A. Theodorou, Michail Kontitsis

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出一种基于路径积分和高斯过程的模型驱动随机优化控制框架,通过有限样本数据自主学习时间变化的最优控制,提升高维复杂任务的控制效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17919 2026-06-02 cs.CE 50%

Training Diffusion Language Models for Black-Box Optimization

训练扩散语言模型用于黑盒优化

Zipeng Sun, Can Chen, Ye Yuan, Haolun Wu, Jiayao Gu, Christopher Pal, Xue Liu

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 针对离线黑盒优化问题,提出通过扩散语言模型的双向建模能力,结合统一语料构建和两阶段后训练框架,实现高效设计生成,在Design-Bench上达到最优性能。

Comments Accepted at ICML 2026 as a Spotlight Paper (top 2.2% of submissions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30690 2026-06-01 cs.CL 50%

ElasticMem: Latent Memory as a Learnable Resource for LLM Agents

ElasticMem: 将潜在记忆作为LLM智能体的可学习资源

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract)

AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24265 2026-05-01 cs.MA 50%

R3DM: Enabling Role Discovery and Diversity Through Dynamics Models in Multi-agent Reinforcement Learning

R3DM:通过动态模型在多智能体强化学习中实现角色发现与多样性

Harsh Goel, Mohammad Omama, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi Pari, Sandeep Chinchali

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 R3DM通过动态模型最大化智能体角色、观察轨迹与预期未来行为间的互信息,提升多智能体协作效率,实验表明其在SMAC和SMACv2环境中显著提升胜率。

Comments 21 pages, To appear in the International Conference of Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05846 2026-04-08 cs.CL 50%

AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning

AgentGL: 通过强化学习实现基于LLM的代理图学习

Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 AgentGL通过强化学习框架实现图学习,结合图导航与LLM推理,提升复杂关系环境下的自主导航与推理能力,优于现有基线方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27364 2026-03-31 cs.NI 50%

DRASTIC: A Dynamic Resource Allocation Framework over 6G Network Slicing in Task-aware Closed-Loop Tactile Internet Applications

DRASTIC:一种面向6G网络切片的动态资源分配框架,用于任务感知闭环触觉互联网应用

Narges Golmohammadi, Madan Mohan Rayguru, Sabur Baidya

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出DRASTIC框架,通过强化学习动态分配资源,满足延迟要求并提高吞吐量,适用于eMBB和HRLLC用户。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22880 2026-03-25 q-fin.GN cs.CE q-fin.PM 50%

Portfolio Optimization under Recursive Utility via Reinforcement Learning

通过强化学习进行递归效用下的投资组合优化

Minkey Chang

专题命中 模仿学习与强化学习 :world model(abstract)

AI总结 本文研究递归效用是否能提升投资组合分配的强化学习效果,通过蒙特卡洛方法近似递归效用中的确定等价,改进了PPO和A2C算法,实验显示在夏普比率、最大回撤和累计收益上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11582 2026-03-13 eess.SY cs.MA cs.SY 50%

Multi-Agent Reinforcement Learning for UAV-Based Chemical Plume Source Localization

基于无人机的化学烟雾源定位的多智能体强化学习

Zhirun Li, Derek Hollenbeck, Ruikun Wu, Michelle Sherman, Sihua Shao, Xiang Sun, Mostafa Hassanalian

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本研究提出基于多智能体深度强化学习的框架,用于无人机在化学烟雾源定位中的高效检测与精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10723 2026-02-17 eess.SY cs.SY 50%

Towards Dynamic Quadrupedal Gaits: A Symmetry-Guided RL Hierarchy Enables Free Gait Transitions at Varying Speeds

迈向动态四足步态:基于对称性的强化学习层次结构实现自由步态转换于不同速度下

Jiayu Ding, Xulin Chen, Garret E. Katz, Zhenyu Gan

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升步态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16648 2026-01-26 eess.SY cs.SY 50%

A Cognitive Framework for Autonomous Agents: Toward Human-Inspired Design

自主代理的认知框架:迈向人机协同设计

Francesco Guidi, Jingfeng Shan, Mehrdad Saeidi, Enrico Testi, Elia Favarelli, Andrea Giorgetti, Davide Dardari, Alberto Zanella, Giorgio Li Pira, Francesca Starita, Anna Guerra

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文提出一种融合经典条件反射与工具性学习的强化学习框架,以提升自主系统在未知环境中的决策效率与合作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16061 2026-01-23 eess.SY cs.SY 50%

Dynamic Tactile Sensing System and Soft Actor Critic Reinforcement Learning for Inclusion Characterization

动态触觉传感系统与软演员评论强化学习用于包容体表征

John Bannan, Nazia Rahman, Chang-Hee Won

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出一种结合机器人触觉传感与软演员评论强化学习的动态触觉传感系统,用于精准定位和表征嵌入的包容体,实验表明其在尺寸估计精度上优于人工操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL 50%

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17841 2025-12-22 cs.CE cs.SY eess.SY 50%

NeuRehab: A Reinforcement Learning and Spiking Neural Network-Based Rehab Automation Framework

NeuRehab:一种基于强化学习和脉冲神经网络的康复自动化框架

Phani Pavan Kambhampati, Chainesh Gautam, Jagan Palaniswamy, Madhav Rao

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 NeuRehab通过结合强化学习和脉冲神经网络,实现康复自动化框架,优化功耗和延迟,提升神经形态部署性能。

Comments 18 pages, 22 figures, 3 tables, for submission to IOP Neuromorphic Computing and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL 50%

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06645 2025-12-09 cs.MA 50%

Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning

通过多智能体强化学习分析大规模混合交通控制中的碰撞率

Muyang Fan

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06095 2025-12-09 cond-mat.str-el 50%

Comparative Analysis of Autonomous and Systematic Control Strategies for Hole-Doped Hubbard Clusters: Reinforcement Learning versus Physics-Guided Design

自适应与系统化控制策略在掺空Hubbard簇中的比较分析:强化学习与物理引导设计

Shivanshu Dwivedi, Kalum Palandage

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文比较了自主强化学习与物理引导设计在掺空Hubbard簇中的表现,证明自主RL在优化和策略发现中具有高效性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20953 2025-12-05 eess.SY cs.SY 50%

Optimality and Suboptimality of MPPI Control in Stochastic and Deterministic Settings

在随机和确定性设置中MPPI控制的最优性与次优性质

Hannes Homburger, Florian Messerer, Moritz Diehl, Johannes Reuter

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文研究了MPPI控制在确定性系统中的次优性质,并通过调整超参数来调节其性能。

Comments 6 pages, 3 figures, submitted to LCSS with CDC25 option

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17653 2025-11-25 math.GM 50%

MARL-CC: A Mathematical Framework forMulti-Agent Reinforcement Learning in ConnectedAutonomous Vehicles: Addressing Nonlinearity,Partial Observability, and Credit Assignment forOptimal Control

MARL-CC:多智能体强化学习在连接自动驾驶车辆中的数学框架:解决非线性、部分可观测性和信用分配以实现最优控制

Mazyar Taghavi, Javad Vahidi

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 MARL-CC提出了一种统一的数学框架,通过整合微分几何控制、贝叶斯推断和夏普利值信用分配,解决多智能体强化学习中的非线性、部分可观测性和信用分配问题,提升收敛速度和协同效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12145 2025-11-25 physics.optics 50%

LLM4Laser: Large Language Models Automate the Design of Lasers

LLM4Laser: 利用大语言模型自动化激光器设计

Renjie Li, Ceyao Zhang, Sixuan Mao, Xiyuan Zhou, Feng Yin, Sergios Theodoridis, Zhaoyu Zhang

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出利用大语言模型实现激光器设计自动化,通过对话生成仿真和强化学习代码,实现从概念到算法的全流程自动化设计。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17304 2025-11-24 q-fin.CP 50%

Law-Strength Frontiers and a No-Free-Lunch Result for Law-Seeking Reinforcement Learning on Volatility Law Manifolds

法律强度前沿与在波动率法律流形上寻求法律的强化学习的无免费午餐结果

Jian'an Zhang

专题命中 模仿学习与强化学习 :world model(abstract)

AI总结 本文研究了在波动率法律流形上强化学习的法律强度权衡及无免费午餐问题,通过实验揭示法律寻求RL在波动率建模中的局限性。

Comments 61 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏