arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-09-01 至 2026-09-01 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 10 篇

2607.01651 2026-09-01 cs.RO 版本更新 79%

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-09-01 cs.LG cs.CL cs.RO 版本更新 73%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03741 2026-09-01 cs.LG cs.AI cs.CR 版本更新 73%

SUB-PLAY: Adversarial Policies against Partially Observed Multi-Agent Reinforcement Learning Systems

SUB-PLAY:针对部分可观测多智能体强化学习系统的对抗策略

Oubo Ma, Yuwen Pu, Linkang Du, Yang Dai, Ruo Wang, Xiaolei Liu, Yingcai Wu, Shouling Ji

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出新型黑盒攻击SUB-PLAY,可在多智能体竞争环境中利用部分观测生成对抗策略,经评估其有效性,还为MARL部署提供防御建议。

Comments To appear in the ACM Conference on Computer and Communications Security (CCS'24), October 14-18, 2024, Salt Lake City, UT, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29768 2026-09-01 cs.RO 新提交 70%

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL:异步执行期间的在线强化学习

Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 模仿学习与强化学习 :robot foundation model(abstract);robotic(abstract);分类 cs.RO

AI总结 SmoothRL是一种在异步推理循环内微调预训练策略的在线RL框架,通过显式建模异步推理过程优化策略,在高精度及高度动态机器人任务上实现有效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 70%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31167 2026-09-01 cs.RO cs.AI 新提交 62%

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

SUN:用于语言接地控制学习到真实策略的持久程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Amazon(亚马逊公司) Robotics and AI Institute(机器人与人工智能研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出语义统一(SUN)程序及系统Kuafu,由大型视觉语言系统自动合成,在9项任务中实现82.03%宏观成功率,优于相关基准,可将控制摊销为鲁棒策略,实现符号规划与数据驱动执行的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29061 2026-09-01 cs.LG cs.RO 新提交 62%

PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning

PathBridger:面向离线目标条件强化学习的子目标桥接方法

Soohyun Choi, Seonvin Cho, Songnam Hong

机构 * Hanyang University(汉阳大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 PathBridger是一种分层离线目标条件强化学习方法,通过构建状态空间桥并结合逆动力学模型解码为动作块,在OGBench任务尤其是多目标Cube操作任务上性能显著提升。

Comments 14 pages, 2 figures. Code: https://github.com/SChoish/PathBridger

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29953 2026-09-01 cs.AI 新提交 57%

SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking

SearchWiki:学习构建与导航知识Wiki以支持主动信息检索

Guransh Singh, Vishwajeet Kumar, Arkadeep Acharya, Adnan Qidwai, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 该研究提出SearchWiki框架,将语料库合成分层可导航Wiki,训练WikiResearcher-9B智能体经强化学习优化导航策略,在多基准测试中表现优于同规模模型,证实结构化语料库学习式导航优于扁平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00384 2026-09-01 cs.RO 版本更新 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13415 2026-09-01 cs.MA cs.AI 版本更新 57%

A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives

多智能体协同决策综合综述:场景、方法、挑战与展望

Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

机构 * The University of Hong Kong (HKU)(香港大学) Imperial College London(伦敦帝国学院) National Heart and Lung Institute, Imperial College London(伦敦帝国学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 该综述梳理多智能体协同决策的场景、方法等,重点分析深度多智能体强化学习与大语言模型驱动的多智能体方法,同时指出领域挑战与未来研究方向。

Comments 54 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏