arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-13 至 2026-02-13 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2510.15189 2026-02-13 cs.RO 79%

RM-RL: Role-Model Reinforcement Learning for Precise Robot Manipulation

RM-RL:基于角色模型的强化学习用于精确机器人操控

Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(马斯实验室,南洋理工大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 RM-RL通过角色模型策略实现精确机器人操控,无需人类示范,提升在线和离线训练效率,实验显示在现实任务中精度显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05696 2026-02-13 cs.LG cs.AI cs.RO 75%

A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation

一种多保真度控制变量化法用于策略梯度估计

Xinjie Liu, Cyrus Neary, Kushagra Gupta, Wesley A. Suttle, Christian Ellis, Ufuk Topcu, David Fridovich-Keil

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) The University of British Columbia(不列颠哥伦比亚大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种多保真度控制变量化方法,通过结合稀缺目标环境数据和丰富的低保真度模拟数据,提高策略梯度估计的样本效率和收敛速度,适用于有限高保真度数据但丰富低保真度数据的机器人任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 62%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11524 2026-02-13 cs.LG cs.AI cs.CL 62%

Adaptive Milestone Reward for GUI Agents

自适应里程碑奖励用于GUI代理

Congmin Zheng, Xiaoyun Mo, Xinbei Ma, Qiqiang Lin, Yin Zhao, Jiachen Zhu, Xingyu Lou, Jun Wang, Zhaoxiang Wang, Weiwen Liu, Zhuosheng Zhang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ADMIRE通过自适应里程碑奖励机制,解决长周期任务中奖励保真度与密度的矛盾,提升GUI代理的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12314 2026-02-13 cs.LG cs.AI cs.CE cs.CR 62%

Thought Purity: A Defense Framework For Chain-of-Thought Attack

思维纯洁性:针对思维链攻击的防御框架

Zihao Xue, Zhen Bi, Long Ma, Zhenlin Hu, Yan Wang, Xueshu Chen, Zhenfang Liu, Kang Zhao, Jie Xiao, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TP框架,通过整合安全数据管道与强化学习,有效防御思维链攻击,同时保持模型在良性任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11464 2026-02-13 cs.RO 57%

EasyMimic: A Low-Cost Framework for Robot Imitation Learning from Human Videos

EasyMimic: 一种低成本的机器人模仿学习框架

Tao Zhang, Song Xia, Ye Wang, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 EasyMimic通过低成本框架实现机器人从人类视频快速学习操控策略,减少对昂贵数据的依赖,推动家庭机器人发展。

Comments icra 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10455 2026-02-13 cs.RO cs.SY eess.SY 57%

Towards Dynamic Quadrupedal Gaits: A Symmetry-Guided RL Hierarchy Enables Free Gait Transitions at Varying Speeds

迈向动态四足步态:基于对称性的强化学习层级实现自由步态转换以适应不同速度

Jiayu Ding, Xulin Chen, Garrett E. Katz, Zhenyu Gan

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升运动适应性。

Comments This work is build on reusing the main novel concept from arXiv:2403.10723. Based on the reviews we accept while submitting this work, we decided to resubmit this work as a replacement of the linked work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02087 2026-02-13 cs.LG stat.ML 57%

Beyond CVaR: Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement Learning

超越CVaR:利用静态谱风险度量提升分布式强化学习中的决策质量

Mehrdad Moghimi, Hyejin Ku

机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种具有收敛保证的DRL算法,优化更广泛的静态谱风险度量,提升决策质量并优于现有方法。

Comments Accepted at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:44571-44593, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏