arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4126 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4126 篇

2604.19730 2026-04-22 cs.LG cs.AI 62%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16850 2026-04-21 cs.RO cs.AI cs.SY eess.SY 62%

Refinement of Accelerated Demonstrations via Incremental Iterative Reference Learning Control for Fast Contact-Rich Imitation Learning

通过增量迭代参考学习控制细化加速演示

Koki Yamane, Cristian C. Beltran-Hernandez, Steven Oh, Masashi Hamaya, Sho Sakaino

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tsukuba(茨口大学) Waseda University(早稻田大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出I2RLC方法,通过逐步提升速度并更新参考轨迹,实现高保真度的加速演示,提升接触密集模仿学习的效率与稳定性。

Comments 8 pages, 11 figures, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16158 2026-04-20 cs.CL cs.AI cs.LG 62%

AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

AtManRL:通过可微注意力显著性实现更忠实的推理

Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha研究实验室) TU Darmstadt(图林根大学) Hessian.AI Lab(黑森AI实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AtManRL方法,通过可微注意力操控学习更忠实的推理过程,结合GRPO框架优化正确性与可解释性,实验证明能识别关键推理token并提升模型透明度。

Comments 14 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 62%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20869 2026-04-17 cs.LG cs.AI 62%

Model-Based Reinforcement Learning under Random Observation Delays

基于模型的强化学习在随机观测延迟下的应用

Armin Karamzade, Kyungmin Kim, JB Lanier, Davide Corsi, Roy Fox

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学尔湾分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了POMDPs中的随机传感器延迟问题,提出了一种基于模型的过滤过程和延迟感知框架,以提升强化学习在随机延迟环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13891 2026-04-16 cs.RO cs.AI cs.SY eess.SY 62%

Beyond Conservative Automated Driving in Multi-Agent Scenarios via Coupled Model Predictive Control and Deep Reinforcement Learning

通过耦合模型预测控制和深度强化学习实现多智能体场景下的非保守自动驾驶

Saeed Rahmani, Gözde Körpe, Zhenlin, Xu, Bruno Brito, Simeon Craig Calvert, Bart van Arem

机构 * TU Delft, Faculty of Civil Engineering and Geosciences, Department of Transport and Planning(代尔夫特理工大学,土木工程与地质科学学院,交通与规划系) NVIDIA

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出结合MPC与RL的框架,提升多智能体场景下的导航性能,实验表明MPC-RL在碰撞率和成功率上优于传统方法,且在零样本迁移中表现更优,展示了MPC对跨场景鲁棒性的贡献。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 62%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO 62%

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09452 2026-04-13 cs.LG cs.AI 62%

SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning

SafeAdapt: 在深度强化学习中提供安全的策略更新

Maksim Anisimov, Francesco Belardinelli, Matthew Wicker

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeAdapt方法,通过引入Rashomon集在连续强化学习中提供安全策略更新的正式保证,确保在下游适应过程中源任务的安全性。

Comments Code available at: https://github.com/maxanisimov/provably-safe-policy-updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09035 2026-04-13 cs.AI cs.LG 62%

Advantage-Guided Diffusion for Model-Based Reinforcement Learning

基于优势的扩散模型用于基于模型的强化学习

Daniele Foffano, Arvid Eriksson, David Broman, Karl H. Johansson, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Digital Futures(数字未来)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGD-MBRL,通过利用智能体的优势估计引导反向扩散过程,提升长周期回报。采用SAG和EAG两种引导方法,改进了短周期视角下的扩散模型MBRL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04334 2026-04-13 cs.LG cs.AI 62%

Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications

提升分布强化学习:分析与医疗应用

Zequn Chen, Wesley J. Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。

Comments Preprint. 40 pages,11 figures. Supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25241 2026-04-08 cs.RO cs.AI 62%

One-shot Adaptation of Humanoid Whole-body Motion with Walking Priors

单样本适应人类全身体态与行走先验

Hao Huang, Geeta Chandra Raju Bethala, Shuaihang Yuan, Congcong Wen, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab, NYUAD(纽约大学阿布扎比分校具身人工智能与机器人实验室) NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) New York University Abu Dhabi(纽约大学阿布扎比分校) Harvard Ophthalmology AI Lab, Harvard University(哈佛大学眼科人工智能实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种高效适应全身体态的方法,利用行走先验和单样本目标生成中间姿态,通过最优传输和几何插值实现碰撞自由配置,实验显示优于基线方法。

Comments 14 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 62%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16705 2026-04-03 cs.RO cs.LG 62%

Olaf: Bringing an Animated Character to Life in the Physical World

奥拉夫:将动画角色带入现实世界

David Müller, Espen Knoop, Dario Mylonopoulos, Agon Serifi, Michael A. Hopkins, Ruben Grandia, Moritz Bächer

机构 * Disney Research Imagineering(迪士尼研究与工程)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文通过强化学习结合动画参考,使奥拉夫在现实世界中活动,采用软泡沫裙隐藏不对称腿部,利用球形和平面连杆实现动作控制,并通过温度输入和额外奖励减少过热风险,验证了其在仿真和硬件中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27416 2026-03-31 cs.RO cs.AI 62%

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

由代理驱动的自主强化学习研究:四足运动的迭代策略改进

Nimesh Khandelwal, Shakti S. Gupta

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23889 2026-03-26 cs.LG cs.RO 62%

Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration

基于约束乐观探索的非策略安全强化学习

Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij

机构 * Faculty of Mechanical Engineering(机械工程学院) Delft University of Technology(代尔夫特理工大学) Faculty of Electrical Engineering, Mathematics and Computer Science(电气工程、数学和计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出COX-Q算法,通过约束乐观探索和保守离线分布价值学习,解决非策略安全强化学习中的约束违反问题,实现在安全关键应用中的高效样本利用和可控数据收集成本。

Comments 21 pages, 9 figures, accepted by ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14469 2026-03-24 cs.RO cs.LG 62%

Physics-Informed Policy Optimization via Analytic Dynamics Regularization

通过解析动力学正则化实现物理信息的策略优化

Namai Chandra, Liu Mohan, Zhihao Gu, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University, Singapore(EmPACT实验室,南洋理工大学,新加坡)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出PIPER框架,通过在神经策略优化中引入解析软物理约束,提升机器人控制的效率和物理一致性。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 62%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO 62%

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 62%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17152 2026-03-19 cs.RO cs.LG 62%

Shielded Reinforcement Learning Under Dynamic Temporal Logic Constraints

受动态时序逻辑约束的防护强化学习

Sadık Bera Yüksel, Ali Tevfik Buyukkocak, Derya Aksaray

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种结合序列控制屏障函数和无模型强化学习的框架,以满足复杂的时序逻辑任务,扩展了传统安全约束的应用范围。

Comments 7 pages, 3 figures, 2026 IEEE American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16978 2026-03-19 cs.RO cs.LG 62%

Rewarding DINO: Predicting Dense Rewards with Vision Foundation Models

奖励DINO:基于视觉基础模型预测密集奖励

Pierre Krack, Tobias Jülg, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Rewarding DINO,一种基于语言条件的奖励模型,通过学习实际奖励函数而非特定轨迹,实现机器人操作任务的密集奖励预测,具有紧凑结构和低计算开销,能有效泛化至新场景。

Comments 10 pages, 5 figures, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16384 2026-03-18 cs.RO cs.LG q-bio.PE 62%

Controlling Fish Schools via Reinforcement Learning of Virtual Fish Movement

通过虚拟鱼运动的强化学习控制鱼群

Yusuke Nishii, Hiroaki Kawashima

机构 * Faculty of Engineering, Kyoto University(京都大学工学部)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文通过强化学习训练虚拟鱼,实现对鱼群的引导与控制,实验证明该方法在模拟和实际环境中均能有效引导鱼群向目标方向移动,优于基线方法。

Comments English translation of the author's 2018 bachelor's thesis. Keywords: fish schooling, reinforcement learning, collective behavior, artificial agents, swarm-machine interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI 62%

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15725 2026-03-18 cs.MA cs.ET cs.LG cs.RO 62%

S2Act: Simple Spiking Actor

S2Act: 简单的脉冲行为者

Ugur Akcal, Seung Hyun Kim, Mikihisa Yuasa, Hamid Osooli, Jiarui Sun, Ribhav Sahu, Mattia Gazzola, Huy T. Tran, Girish Chowdhary

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 S2Act通过构建基于速率脉冲神经元的actor-critic模型,利用梯度训练并转换为物理参数,有效解决SNN中的梯度消失问题,提升多机器人任务的实时推理性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 62%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 62%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI 62%

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11351 2026-03-13 cs.RO cs.AI 62%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00915 2026-03-12 cs.LG cs.RO 62%

Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments

部分等价强化学习在对称破坏环境中

Junwoo Chang, Minwoo Park, Joohwan Seo, Roberto Horowitz, Jongmin Lee, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University, Seoul, South Korea(延世大学机械工程学院,首尔,韩国) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系,首尔,韩国) Department of Mechanical Engineering, University of California, Berkeley, United States(加州大学伯克利分校机械工程系,美国)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出部分等价强化学习框架,通过选择性应用群不变或标准贝尔曼备份,提升样本效率和泛化能力,适用于对称破坏环境的离散和连续控制任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏