arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2602.12520 2026-02-16 cs.LG cs.MA 57%

Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings

基于联合状态-动作学习嵌入的多智能体模型驱动强化学习

Zhizun Wang, David Meger

机构 * McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11464 2026-02-13 cs.RO 57%

EasyMimic: A Low-Cost Framework for Robot Imitation Learning from Human Videos

EasyMimic: 一种低成本的机器人模仿学习框架

Tao Zhang, Song Xia, Ye Wang, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 EasyMimic通过低成本框架实现机器人从人类视频快速学习操控策略,减少对昂贵数据的依赖,推动家庭机器人发展。

Comments icra 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10455 2026-02-13 cs.RO cs.SY eess.SY 57%

Towards Dynamic Quadrupedal Gaits: A Symmetry-Guided RL Hierarchy Enables Free Gait Transitions at Varying Speeds

迈向动态四足步态:基于对称性的强化学习层级实现自由步态转换以适应不同速度

Jiayu Ding, Xulin Chen, Garrett E. Katz, Zhenyu Gan

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升运动适应性。

Comments This work is build on reusing the main novel concept from arXiv:2403.10723. Based on the reviews we accept while submitting this work, we decided to resubmit this work as a replacement of the linked work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02087 2026-02-13 cs.LG stat.ML 57%

Beyond CVaR: Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement Learning

超越CVaR:利用静态谱风险度量提升分布式强化学习中的决策质量

Mehrdad Moghimi, Hyejin Ku

机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种具有收敛保证的DRL算法,优化更广泛的静态谱风险度量,提升决策质量并优于现有方法。

Comments Accepted at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:44571-44593, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10547 2026-02-12 cs.RO 57%

ReSPEC: A Framework for Online Multispectral Sensor Reconfiguration in Dynamic Environments

ReSPEC:动态环境中在线多光谱传感器重新配置框架

Yanchen Liu, Yuang Fan, Minghui Zhao, Xiaofan Jiang

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04538 2026-02-12 cs.LG 57%

HypeRL: Hypernetwork-Based Reinforcement Learning for Control of Parametrized Dynamical Systems

HypeRL: 基于超网络的强化学习用于参数化动力系统控制

Nicolò Botteghi, Stefania Fresca, Mengwu Guo, Andrea Manzoni

机构 * MOX - Department of Mathematics Politecnico di Milano(米兰理工数学系MOX部门) Department of Mechanical Engineering University of Washington(华盛顿大学机械工程系) Centre for Mathematical Sciences Lund University(卢德大学数学科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 HypeRL通过超网络强化学习方法,解决参数化动力系统控制问题,实现高效泛化和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 57%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 57%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06326 2026-02-09 cs.LG 57%

Online Adaptive Reinforcement Learning with Echo State Networks for Non-Stationary Dynamics

在线自适应强化学习与回声状态网络用于非平稳动态

Aoi Yoshimura, Gouhei Tanaka

机构 * Department of Computer Science, Nagoya Institute of Technology(名古屋技术大学计算机科学系) Nagoya Institute of Technology(名古屋技术大学) International Research Center for Neurointelligence, The University of Tokyo(神经智能国际研究中心,东京大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出基于回声状态网络的在线自适应强化学习框架,通过共振计算实现快速适应,适用于非平稳动态环境中的实时机器人控制。

Comments Submitted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03171 2026-02-04 cs.LG 57%

StepScorer: Accelerating Reinforcement Learning with Step-wise Scoring and Psychological Regret Modeling

StepScorer: 通过分步评分与心理遗憾建模加速强化学习

Zhe Xu

机构 * INDEPENDENT RESEARCHER(独立研究者)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 StepScorer通过分步评分与心理遗憾建模,加速强化学习收敛,适用于连续控制任务和延迟反馈环境。

Comments 10 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02831 2026-02-04 cs.RO 57%

Adaptive Linear Path Model-Based Diffusion

基于自适应线性路径模型的扩散

Yutaka Shimizu, Masayoshi Tomizuka

机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出LP-MBD和ALP-MBD,通过线性概率路径和强化学习提升扩散模型在机器人控制中的适应性和鲁棒性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02283 2026-02-03 cs.LG stat.ML 57%

Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management

基于选择模型的Q学习用于延迟反馈收益管理

Owen Shen, Patrick Jaillet

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01040 2026-02-03 cs.RO 57%

Learning Adaptive Cross-Embodiment Visuomotor Policy with Contrastive Prompt Orchestration

学习适应性跨主体视觉运动策略与对比提示协调

Yuhang Zhang, Chao Yan, Jiaxi Yu, Jiaping Xiao, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 CAPO通过对比提示学习和自适应提示协调,提升跨主体视觉运动策略的适应性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00452 2026-02-03 cs.LG 57%

Imitation from Observations with Trajectory-Level Generative Embeddings

通过轨迹级生成嵌入进行观察模仿学习

Yongtao Qu, Shangzhe Li, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 TGE通过轨迹级生成嵌入解决离线模仿学习中专家数据稀缺的问题,利用时序扩散模型构建平滑奖励,提升离线数据与专家行为间的学习信号。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10007 2026-02-03 cs.LG math.OC stat.ML 57%

Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning

分布鲁棒平均奖励强化学习的样本复杂度

Zijun Chen, Shengbo Wang, Nian Si

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出两种算法,实现了分布鲁棒平均奖励强化学习的近最优样本复杂度,通过锚定状态稳定转移核并保证收敛性。

Comments Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18847 2026-02-02 cs.LG 57%

Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning

离线目标条件强化学习与投影拟度规划

Anthony Kobanda, Waris Radji, Mathieu Petitbois, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Ubisoft la Forge University of Angers(昂热大学) Inria(法国国家科学研究中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出ProQ框架,通过学习非对称距离和结合拉格朗日检测器,实现目标条件强化学习中子目标生成与长期目标达成的稳健控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 57%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09797 2026-01-30 cs.RO 57%

FLARE: Agile Flights for Quadrotor Cable-Suspended Payload System via Reinforcement Learning

FLARE:通过强化学习实现四旋翼缆悬载具系统的敏捷飞行

Dongcheng Cao, Jin Zhou, Xian Wang, Shuo Li

机构 * College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 FLARE通过强化学习实现四旋翼缆悬载具系统的敏捷飞行,相比传统方法提升了3倍的执行速度,并实现了高效的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06284 2026-01-30 cs.AI 57%

CURIOUS: Intrinsically Motivated Modular Multi-Goal Reinforcement Learning

CURIOUS:内在动机的模块化多目标强化学习

Cédric Colas, Pierre Fournier, Olivier Sigaud, Mohamed Chetouani, Pierre-Yves Oudeyer

机构 * Flowers Team, Inria and Ensta ParisTech(Inria和Ensta巴黎科技大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 CURIOUS通过内在动机探索和自动课程学习机制,实现模块化多目标强化学习的自组织发展。

Comments Accepted at ICML 2019 https://github.com/flowersteam/curious

Journal ref Proceedings of the 36th International Conference on Machine Learning 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 57%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23077 2026-01-27 cs.RO 57%

Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models

具身学习奖励以实现肌肉骨骼控制与视觉语言模型

Saraswati Soedarmadji, Yunyue Wei, Chen Zhang, Yisong Yue, Yanan Sui

机构 * Tsinghua University(清华大学) California Institute of Technology(加州理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出MoVLR框架,利用视觉语言模型实现高维肌肉骨骼系统的具身学习,通过迭代交互发现和改进奖励函数。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05092 2026-01-26 cs.LG 57%

Task Aware Dreamer for Task Generalization in Reinforcement Learning

面向任务泛化的任务感知梦者

Chengyang Ying, Xinning Zhou, Zhongkai Hao, Hang Su, Songming Liu, Dong Yan, Jun Zhu

机构 * Department of Computer Science and Technology(计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学国家研究中心) Tsinghua-Bosch Joint Center for Machine Learning, Institute for Artificial Intelligence(清华大学-博世联合机器学习中心,人工智能研究院) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出任务感知梦者(TAD)方法,通过整合奖励引导的特征提升强化学习中任务泛化能力,尤其在高任务分布相关性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12091 2026-01-22 cs.LG 57%

GraphPerf-RT: A Graph-Driven Performance Model for Hardware-Aware Scheduling of OpenMP Codes

GraphPerf-RT: 一种基于图的性能模型用于OpenMP代码的硬件感知调度

Mohammad Pivezhandi, Mahdi Banisharif, Saeed Bakhshan, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 GraphPerf-RT通过结合任务拓扑、代码语义和运行时上下文,实现高效硬件感知调度,提升性能与能效。

Comments 49 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01147 2026-01-21 cs.RO 57%

Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following

Astra:面向具身指令跟随的高效Transformer架构与对比动态学习

Yueen Ma, Dafeng Chi, Shiguang Wu, Yuecheng Liu, Yuzheng Zhuang, Irwin King

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 Astra通过引入轨迹注意力和对比动态学习目标,提升了具身指令跟随任务中多模态序列处理的效率与准确性。

Comments Accepted to EMNLP 2025 (main). Published version: https://aclanthology.org/2025.emnlp-main.688/ Code available at: https://github.com/yueen-ma/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 57%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08210 2026-01-14 cs.LG 57%

Scalable Multiagent Reinforcement Learning with Collective Influence Estimation

可扩展的多智能体强化学习与集体影响估计

Zhenglong Luo, Zhiyong Chen, Aoxiang Liu, Ke Pan

机构 * School of Engineering, The University of Newcastle(工程学院) School of Automation, Central South University(自动化学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展的多智能体强化学习框架,通过集体影响估计网络实现高效协作,避免网络扩展并提升鲁棒性和部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 57%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14178 2026-01-13 cs.LG 57%

FlowRL: Flow-Augmented Few-Shot Reinforcement Learning for Semi-Structured Sensor Data

FlowRL: 用于半结构化传感器数据的流增强少样本强化学习

Mohammad Pivezhandi, Abusayeed Saifullah

机构 * Wayne State University(韦恩州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 FlowRL 通过生成高质量合成数据提升少样本强化学习的样本效率和策略鲁棒性,有效应用于半结构化传感器数据场景。

Comments 13 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01206 2026-01-08 cs.RO 57%

Action Tokenizer Matters in In-Context Imitation Learning

动作分词器在上下文模仿学习中的重要性

An Dinh Vuong, Minh Nhat Vu, Dong An, Ian Reid

机构 * Department of Computer Vision, Mohammed bin Zayed University of Artificial Intelligence(计算机视觉系,穆罕默德·本·扎耶德人工智能大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出LipVQ-VAE,通过强制潜在动作空间的Lipschitz条件,提升上下文模仿学习中动作的稳定性和平滑性。

Comments IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏