arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2606.02337 2026-06-02 cs.AI 57%

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

约束多智能体强化学习的协调图

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson

机构 * Department of Electrical and Computer Engineering, Linköping University(1 链çe普大学电气与计算机工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出CG-CMARL框架,利用协调图和拉格朗日对偶分解联合动作空间与约束耦合问题,实现独立于智能体数量的模型学习,并通过Max-Sum消息传递和拉格朗日乘子控制目标-约束权衡,生成帕累托前沿。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 40 pages (12 main + 28 appendix), 5 figures, 16 tables, 7 theorems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02280 2026-06-02 cs.RO 57%

Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation

动力学是学出来的,不是告诉的:零样本策略适应的潜在动力学几何半监督发现

Zhiming Xu, Weitao Zhou, Xianghui Pan, Nanshan Deng, Chengju Liu, Qijun Chen, Chenpeng Yao

机构 * Zhiming Xu(徐志明) Weitao Zhou(周伟涛) Xianghui Pan(潘向辉) Nanshan Deng(邓南山) Chengju Liu(刘成军) Qijun Chen(陈齐军) Chenpeng Yao(姚晨鹏)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对机器人强化学习中动力学变化导致策略失效的问题,提出基于对比学习的半监督方法,通过构建平滑、任务相关的潜在拓扑结构,实现零样本策略适应,在MuJoCo基准上优于参数中心方法。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01868 2026-06-02 cs.LG 57%

Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

任务诱导的表征不变性依赖于深度强化学习中的学习目标

Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过MDP约简理论分析深度强化学习中的表征,发现基于价值的方法(DQN)学习对MDP同态对称性不变的表征,而基于策略梯度的方法(PPO)学习对动作对称性不变的表征,这些差异影响迁移学习并在LLM中呈现提示依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 57%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00730 2026-06-02 cs.RO 57%

Infeasible optimization problems and the hierarchical augmented Lagrangian method in imitation learning

模仿学习中的不可行优化问题与分层增广拉格朗日方法

Roland Andrews, Justin Carpentier, Ajay Sathya

机构 * University of Cambridge(剑桥大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对模仿学习中约束不可行导致训练不稳定的问题,提出基于增广拉格朗日方法的解决方案,将策略引导至最近可行约束问题的解,并在驾驶示例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00427 2026-06-02 cs.LG 57%

Topology-Aware State Abstraction with Tangle Cores for Markov Decision Processes

基于纠缠核的马尔可夫决策过程拓扑感知状态抽象

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出纠缠核抽象框架,利用经验转移图的图纠缠构建重叠状态抽象,在动作一致性条件下保证价值保持,并通过实验证明其在瓶颈领域优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 57%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31256 2026-06-01 cs.RO 57%

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

在封闭停车场之前:面向自动驾驶高效具身大语言模型的强化学习时间剪枝

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

机构 * Department of Control and Computer Engineering(控制与计算机工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出一种在强化学习过程中进行剪枝的策略BPF,通过任务特定监督和闭环反馈压缩具身大语言模型控制器,在自动驾驶控制管道中实现了更好的性能-内存-吞吐量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30576 2026-06-01 cs.AI 57%

Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

自动驾驶强化学习中不确定性感知与时间调控的专家建议

Ahmed Abouelazm, Felix Klingebiel, Philip Schörner, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出一种不确定性感知框架,通过自适应阈值触发专家建议并采用承诺-冷却策略调控指导时长,结合离线策略隐式分位数网络实现安全高效的探索,在CARLA中成功率提升5-7%。

Comments Accepted in The IEEE International Conference on Intelligent Transportation Systems (ITSC) September 15-18, 2026 -- Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02217 2026-06-01 cs.LG 57%

Population-Free Pareto Tracking for Sample-Efficient Multi-Policy MORL

无种群的帕累托跟踪:面向样本高效的多策略多目标强化学习

Zeyu Zhao, Yueling Che, Kaichen Liu, Jian Li, Junmei Yao

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 提出MPFT框架,通过无自进化种群的帕累托跟踪机制,结合单目标极端策略初始化,高效逼近完整帕累托前沿,显著提升样本效率并减少智能体-环境交互。

Comments 37 pages, 10 figures, ICML26 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12815 2026-05-29 cs.LG 57%

TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models

TrojanTO:针对轨迹优化模型的行动级后门攻击

Yang Dai, Oubo Ma, Longfei Zhang, Xingxing Liang, Xiaochun Cao, Shouling Ji, Jiaheng Zhang, Jincai Huang, Li Shen

机构 * Laboratory for Big Data and Decision, National University of Defense Technology(大数据与决策实验室,国防科技大学) Zhejiang University(浙江大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出TrojanTO,首个针对轨迹优化模型的行动级后门攻击方法,通过交替训练增强触发与目标动作关联,并利用轨迹过滤和批量投毒实现高隐蔽性,在低攻击预算下有效植入后门。

Comments 23 pages, 6 figures

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29324 2026-05-29 cs.CL cs.CV 57%

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

STAMP:在可控且可扩展的虚拟环境中训练移动GUI代理的显式记忆

Junyang Wang, Haiyang Xu, Xi Zhang, Zhaoqing Zhu, Ming Yan, Jieping Ye, Jitao Sang

机构 * Tongyi AI Lab, Alibaba Group(通义实验室,阿里巴巴集团) Beijing Jiaotong University(北京交通大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 提出STAMP框架,通过可控虚拟环境注入确定性记忆变量,生成可验证监督数据并支持在线强化学习,解决移动GUI代理在长时任务中因上下文窗口限制和缺乏显式记忆导致的失败问题。

Comments 24 pages, 4figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13238 2026-05-29 cs.NI cs.LG 57%

Securing SIM-Assisted Wireless Networks via Quantum Reinforcement Learning

通过量子强化学习保护SIM辅助无线网络

Le-Hung Hoang, Quang-Trung Luu, Dinh Thai Hoang, Diep N. Nguyen, Van-Dinh Nguyen

机构 * Smart Green Transformation Center, VinUniversity(Vin大学智能绿色转型中心) Université Paris-Saclay - CNRS - CentraleSupélec - L2S(巴黎萨克雷大学 - CNRS - 中央超导实验室 - L2S) School of Electrical and Data Engineering, University of Technology Sydney(悉尼技术大学电气与数据工程学院) School of Computer Science and Statistics, Trinity College Dublin, The University of Dublin(都柏林大学三一学院计算机科学与统计学学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 针对SIM辅助无线网络中高维优化和动态环境挑战,提出混合量子近端策略优化框架,联合优化功率分配和SIM相位,实现约15%保密率提升和30%收敛加速。

Comments Submitted to IEEE TCOM: 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06970 2026-05-28 eess.SY cs.LG cs.SY 57%

Falsification-driven reinforcement learning for maritime motion planning

基于证伪驱动的强化学习用于海上运动规划

Marlon Müller, Florian Finkeldei, Hanna Krasowski, Murat Arcak, Matthias Althoff

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Berkeley(加州大学伯克利分校) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出一种证伪驱动的强化学习方法,通过生成对抗性训练场景(违反信号时态逻辑规范的海上交通规则)来提升自主船舶的规则遵守能力,实验表明该方法能提供更相关的训练场景并实现更一致的规则遵守。

Comments 11 pages, 9 figures. Code available at https://fdrl-maritime.github.io

Journal ref Ocean Engineering 361 (2026) 125579

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26282 2026-05-27 cs.LG 57%

Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization

通过扩散策略优化扩展世界模型强化学习

Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

机构 * Dynamic Systems Lab, University College London(伦敦大学学院动态系统实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Santa Fe Institute(圣塔菲研究所) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对世界模型强化学习中搜索与价值学习之间的结构错位问题,提出基于扩散策略优化的模型基方法MBDPO,统一搜索与策略优化,实现可扩展的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24152 2026-05-27 cs.AI 57%

Neuro-Inspired Inverse Learning for Planning and Control

神经启发式逆向学习用于规划与控制

Maryna Kapitonova, Tonio Ball

机构 * NeuroMentum AI IMBIT, University of Freiburg, Germany(NeuroMentum AI IMBIT,弗赖堡大学,德国)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 提出一种神经启发式框架Inverter,通过逆向学习(IL)结合前向/逆向内部模型、开环多步运动指令和层次化动作组织,在规划与控制任务中实现高效推理,平均性能提升24.2%且计算时间降低一到两个数量级。

Comments Version 2, minor fix in online version of the abstract, pdf unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03785 2026-05-27 cs.AI cs.MA 57%

Communication Gain and Delay Cost Under Cross-Timestep Delays in Cooperative Multi-Agent Reinforcement Learning

跨时间步延迟下合作多智能体强化学习中的通信增益与延迟代价

Zihong Gao, Hongjian Liang, Lei Hao, Liangjun Ke

机构 * The State Key Laboratory for Manufacturing Systems Engineering(制造系统工程国家重点实验室) School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 针对部分可观测环境中跨时间步通信延迟导致的信息错位问题,提出通信增益与延迟代价(CGDC)度量,并基于此设计演员-评论家框架CDCMA,通过预测未来观测和注意力融合延迟消息来提升合作多智能体强化学习的性能、鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21845 2026-05-27 cs.LG 57%

Constrained Meta Reinforcement Learning with Provable Test-Time Safety

具有可证明测试时安全性的约束元强化学习

Tingting Ni, Maryam Kamgarpour

机构 * Sycamore Lab, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院萨克森实验室,瑞士拉瓦尔)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出一种约束元强化学习算法,在测试任务上以可证明的安全性和样本复杂度保证学习近似最优策略,并证明样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 57%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04310 2026-05-27 cs.AI 57%

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

EvoEmo:面向多轮价格谈判中对抗性LLM智能体的进化情感策略

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute, London, UK(伦敦阿尔安·图灵研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出EvoEmo进化强化学习框架,通过将情感状态转移建模为马尔可夫决策过程并采用种群遗传优化,动态优化多轮谈判中的情感表达,显著提升LLM智能体的谈判成功率、效率和买家节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22874 2026-05-25 cs.AI cs.LO 57%

NeuroNL2LTL: A Neurosymbolic Framework for Natural Language Translation of Linear Temporal Logic

NeuroNL2LTL:用于线性时序逻辑自然语言翻译的神经符号框架

Paapa Kwesi Quansah, Ernest Bonnah

机构 * Baylor University(贝勒大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 提出NeuroNL2LTL神经符号框架,通过验证器在环训练和最小编辑修复机制,实现自然语言到线性时序逻辑的高可靠性翻译,在20万+需求上达到86%的可满足性输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21688 2026-05-22 cs.RO cs.SY eess.SY 57%

Closed-Loop Sim-to-Real Reinforcement Learning for Deformable Microfiber Shape Control

闭环仿真到现实强化学习用于可变形微纤维形状控制

Alessandro Amici, Houari Bettahar, Veeti Jaakkola, Quan Zhou

机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃大学电气工程与自动化系)

专题命中 模仿学习与强化学习 :manipulation(abstract_cn);分类 cs.RO

AI总结 本文提出了一种闭环仿真到现实强化学习方法,用于在表面控制可变形微纤维形状,通过在简化摩擦模拟器中训练几何形状调节,并利用实时视觉反馈在部署过程中迭代修正未建模的表面相互作用效果。

Comments 7 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI 57%

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07560 2026-05-21 cs.RO 57%

How to Utilize Failure Demo Data?: Effective Data Selection for Imitation Learning Using Distribution Differences in Attention Mechanism

如何利用失败演示数据?:利用注意力机制中的分布差异进行有效的模仿学习数据选择

Kana Miyamoto, Kanata Suzuki, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University, Tokyo, Japan(科学与工程学部,早稻田大学,东京,日本) Physical AI Laboratory, Fujitsu Limited, Kanagawa, Japan(物理人工智能实验室, Fujitsu 有限,神奈川,日本)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种利用注意力机制中的分布差异来有效选择模仿学习数据的方法,通过学习成功-失败差异的潜在表示,提高行动稳定性,并引入一个后训练度量来选择有益于学习的失败样本。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21257 2026-05-21 cs.RO 57%

Reinforcement Learning for Risk Adaptation via Differentiable CVaR Barrier Functions

通过可微分CVaR障碍函数实现风险适应的强化学习

Xinyi Wang, Taekyung Kim, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou

机构 * Department of Robotics(机器人学系) Department of Aerospace Engineering(航空航天工程系) University of Michigan(密歇根大学) Toyota Motor North America, Research & Development(丰田美国北美洲研发)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种端到端的风险适应框架,用于在障碍物运动不确定性的环境下进行人群导航,结合强化学习与基于条件价值-at-风险(CVaR)障碍函数的可微分二次规划安全层,共同学习名义控制输入、风险水平和安全边际,并强制执行显式的概率安全约束。

Comments Project page: https://anonymousrobotics9666.github.io/rlcvarbf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG 57%

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 57%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 57%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14235 2026-05-15 cs.LG cs.MA quant-ph 57%

Quantum Advantage in Multi Agent Reinforcement Learning

量子多智能体强化学习中的量子优势

Simranjeet Singh Dahia, Claudia Szabo

机构 * Adelaide University(阿德莱德大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过实验验证量子纠缠在多智能体强化学习中的协调作用,展示了量子智能体在CHSH游戏中超越经典性能的量子优势,并探讨了不同纠缠结构对性能的影响。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏