arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4126 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4126 篇

2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 62%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24436 2026-05-26 cs.MA cs.LG cs.RO 62%

A Reinforcement Learning Inspired Latent Yield Based Adaptive Algorithm Switching Mechanism

一种受强化学习启发的基于潜在收益的自适应算法切换机制

Jayprakash S. Nair, Jimson Mathew, Shivashankar B. Nair

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对在线或动态环境中算法选择困难的问题,提出一种受强化学习启发的潜在收益方法,通过封装奖励和惩罚触发探索与利用,实现自适应算法切换,并在排序算法和机器人避障任务中验证了有效性。

Comments Accepted and published in the Proceedings of the 29th European Conference on Applications of Evolutionary Computation (EvoApplications 2026), held as part of EvoStar 2026, Toulouse, France, April 8 to 10, 2026. Lecture Notes in Computer Science (LNCS), Springer Nature Switzerland

Journal ref Applications of Evolutionary Computation, EvoApplications 2026, LNCS, Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23372 2026-05-25 cs.LG cs.AI 62%

Curriculum reinforcement learning with measurable task representation learning

基于可度量任务表征学习的课程强化学习

Yongyan Wen, Siyuan Li, Mingjian Fu, Yiqin Yang, Xun Wang, Peng Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fuzhou University(福州大学) China Academy of Sciences(中国科学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于可度量任务表征学习的自动课程生成方法,通过变分自编码器将任务空间映射到具有相似性度量的潜在空间,并据此生成逐步接近目标任务的课程,在复杂导航任务中优于现有插值和生成对抗网络方法。

Journal ref Neural Networks, 109019 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21139 2026-05-25 cs.CV cs.LG 62%

Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving

蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习

Yang Wu, Qiang Meng, Zhaojiang Liu, Youquan Liu, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV、cs.LG

AI总结 提出CoPhy框架,通过蒸馏VLM知识到BEV编码器实现零推理成本的认知能力,并构建自回归BEV世界模型预测未来语义地图以提供可解释的物理沙盒,结合双奖励机制(物理奖励和安全约束、认知奖励和意图对齐)优化驾驶策略,在NAVSIM基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12173 2026-05-25 cs.LG cs.AI 62%

SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks

SkillTree: 面向长时域控制任务的可解释基于技能的深度强化学习

Yongyan Wen, Siyuan Li, Rongchang Zuo, Lei Yuan, Hangyu Mao, Peng Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) National Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies SenseTime Research(商汤科技研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出SkillTree框架,通过可微决策树将连续动作空间离散化为技能空间,实现技能级可解释性,在复杂机器人臂控制任务中达到与基于技能的神经网络相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14648 2026-05-22 cs.RO cs.AI 62%

SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning

SENIOR: 在基于偏好的强化学习中高效查询选择与偏好引导探索

Hexian Ni, Tao Lu, Haoyuan Hu, Yinghao Cai, Shuo Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SENIOR方法,通过高效查询选择和偏好引导探索提升人类反馈效率和策略学习速度,解决基于偏好的强化学习在反馈和样本效率方面的不足。

Comments 8 pages, 8 figures, IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24139 2026-05-21 cs.CV cs.LG 62%

Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection

tutor-student 强化学习:一种动态课程以实现鲁棒的深度伪造检测

Zhanhe Lei, Zhongyuan Wang, Jikang Cheng, Baojin Huang, Yuhong Yang, Zhen Han, Chao Liang, Dengpan Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Information, Huazhong Agricultural University(华中农业大学信息学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种 tutor-student 强化学习框架,通过动态优化训练课程来提高深度伪造检测的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11151 2026-05-21 cs.AI cs.RO 62%

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ: 通过自监督动作排名实现离线到在线强化学习

Andrew Choi, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 模仿学习与强化学习 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出RankQ方法,通过自监督多项排名损失增强时序差分学习,以在大状态-动作空间中更准确地学习批评器,从而在稀疏奖励D4RL基准和基于视觉的机器人学习中实现更高效的离线到在线微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06206 2026-05-21 cs.RO cs.CV 62%

Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model

Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习

Hanqing Wang, Shaoyang Wang, Yiming Zhong, Zemin Yang, Jiamin Wang, Zhiqing Cui, Jiahao Yuan, Yifan Han, Mingyu Liu, Yuexin Ma

机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) ShanghaiTech University(上海科技大学) East China Normal University(华东师范大学) Nanjing University of Information Science & Technology(南京信息工程大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19202 2026-05-20 cs.RO cs.AI math.OC 62%

Aerial Inspection Behaviors via RL-based Quadrotor Control for Under-canopy Forest Environments

通过基于强化学习的四旋翼控制实现空中巡检行为:在树冠下森林环境中的应用

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, Viswa Narayanan Sankaranarayanan, George Nikolakopoulos

机构 * Robotics and AI group, in the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology, Sweden(鲁尔坎大学技术学院机器人与人工智能小组,计算机科学、电气与空间工程系,瑞典)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于深度强化学习的四旋翼控制器,用于在树冠下森林环境中进行自主巡检任务,通过端到端控制策略实现巡检视角姿态跟踪,并结合旅行商问题规划器和快速随机树星规划器确保长距离任务的安全可靠部署。

Comments Submitted to 2026 IEEE 22nd International Conference on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19166 2026-05-20 cs.RO cs.LG math.OC 62%

A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions

一种通过奖励设计和终止条件实现RL基于四旋翼控制性能调优的启发式方法

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, George Nikolakopoulos

机构 * Robotics and AI group, in the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology(鲁德尼大学机器人与人工智能小组,计算机科学、电气与空间工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种新的启发式方法,通过奖励设计和终止条件实现RL四旋翼控制的可调性能,该方法通过双带宽指数奖励结构实现了设定点跟踪的临界阻尼响应,并具有低稳态误差。在使用近端策略优化(PPO)算法训练时,结合episode截断条件,在600万次时间步内以高效的方式实现了所需性能。通过直观的启发式规则调整奖励权重和指数系数,可以实现更快(空翻式)和更慢(检查式)的稳定时间性能,同时保留基线临界阻尼响应和约2%的稳态误差。

Comments Accepted in the 34th Mediterranean Conference on Control and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08052 2026-05-18 cs.RO cs.LG 62%

An Introduction to Deep Reinforcement and Imitation Learning

深度强化学习与模仿学习入门

Pedro Santana

机构 * ISCTE – University Institute of Lisbon(里斯本大学理工学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文介绍深度强化学习和深度模仿学习在具身智能体中的应用,涵盖马尔可夫决策过程、REINFORCE和PPO等核心算法,以及行为克隆、DAgger和GAIL等基础方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15509 2026-05-18 cs.LG cs.RO 62%

parallelcbf: A composable safety-filter and auditability framework for tensor-parallel reinforcement learning

parallelcbf:一种用于张量并行强化学习的可组合安全性过滤和可追溯性框架

Yijun Lu, Zilei Yang, Yuyin Ma

机构 * Xinjiang Key Laboratory of Intelligent Computing and Smart Applications(新疆智能计算与智能应用重点实验室) School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院,中国乌鲁木齐) School of Computing Science, Waseda University, Tokyo, Japan(早稻田大学计算机科学系,日本东京)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 ParallelCBF首次整合了张量并行无人机环境、硬门CBF安全过滤器、分片BC到RL流水线和第一类操作可追溯性,提供可组合的API以实现端到端安全约束训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04539 2026-05-18 cs.LG cs.RO 62%

FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control

FlashSAC: 高维机器人控制中的快速稳定离线强化学习

Donghu Kim, Youngdo Lee, Minho Park, Kinam Kim, I Made Aswin Nahendra, Takuma Seno, Sehee Min, Daniel Palenicek, Florian Vogt, Danica Kragic, Jan Peters, Jaegul Choo, Hojoon Lee

机构 * KTH Royal Institute of Technology(皇家理工学院) German Research Center for AI (DFKI)(德国人工智能研究中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 FlashSAC基于Soft Actor-Critic提出快速稳定的离线强化学习算法,通过减少梯度更新并增大模型规模和数据吞吐量,在高维任务中超越PPO和强离线基线,显著提升训练效率和性能。

Comments RSS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 62%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14297 2026-05-15 cs.LG cs.AI math.OC stat.ML 62%

Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

通过混合梯度在混合离散-连续动作空间中进行策略优化

Matias Alvo, Daniel Russo, Yash Kanoria

机构 * Graduate School of Business Columbia University(哥伦比亚大学商学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合策略优化方法HPO,通过混合梯度估计器解决高维空间中离散-连续动作的策略优化问题,实验显示其在库存控制和切换线性二次调节问题中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14246 2026-05-15 cs.LG cs.AI cs.SY eess.SY 62%

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

动作条件化风险门控用于部分可观测下的安全关键控制

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌) University of Maryland, College Park(马里兰大学 College Park 分校) Stanford University(斯坦福大学) Louisiana State University(路易斯安那州立大学) College of William and Mary(威廉与玛丽学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级风险门控强化学习方法,用于部分可观测环境下风险敏感控制。通过构建紧凑的有限历史代理状态并学习动作条件化的短期安全违规预测,实现风险惩罚与决策时的保守评估,提升安全关键任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14026 2026-05-15 cs.LG cs.AI 62%

R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

R2R2:通过冗余减少在自预测学习中的鲁棒表示

Sanghyeob Song, Donghyeok Lee, Jinsik Kim, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R2R2方法,通过减少冗余提升自预测学习中密集数据重用的鲁棒性,有效缓解过拟合问题,在11个连续控制任务中验证其有效性。

Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21060 2026-05-14 cs.LG cs.AI 62%

On the Sample Complexity of Differentially Private Policy Optimization

关于差分隐私策略优化的样本复杂性

Yi He, Xingyu Zhou

机构 * Wayne State University(韦恩州立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了差分隐私策略优化的样本复杂性,分析了多种策略优化算法在隐私约束下的样本复杂性,揭示隐私成本在样本复杂性中的表现。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11009 2026-05-13 cs.LG cs.RO 62%

ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network

ACSAC:自适应块大小的Actor-Critic与因果TransformerQ网络

Qian Chen, Junqiao Zhao, Hongtu Zhou, Hang Yu, Yanping Zhao, Chen Ye, Guang Chen

机构 * Tongji University(同济大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 针对长 horizon、稀疏奖励任务,ACSAC通过自适应块大小实现平衡反应与时间一致性,提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06182 2026-05-12 cs.RO cs.LG 62%

Apple: Toward General Active Perception via Reinforcement Learning

Apple:通过强化学习实现通用主动感知

Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters

机构 * Department of Computer Science, TU Darmstadt, Germany(德国图林根大学计算机科学系) LIRIS, CNRS UMR5205, École Centrale de Lyon, France(法国里里萨大学LIRIS实验室) LASR Lab & CeTI, TU Dresden, Germany(德国德累斯顿技术大学LASR实验室) DFKI, Hessian.AI, RIG, and Centre for Cognitive Science, TU Darmstadt, Germany(德国图林根大学DFKI、海德堡人工智能、RIG及认知科学中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Apple框架,通过强化学习解决多种主动感知问题,展示了其在触觉探索任务中的有效性,证明了其在机器人领域中的通用性。

Comments 27 pages; 21 figures; accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL 62%

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 62%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08182 2026-05-12 cs.LG cs.AI 62%

Quantile Geometry Regularization for Distributional Reinforcement Learning

分位数几何正则化用于分布性强化学习

Zhaofan Zhang, Minghao Yang, Rufeng Chen, Sihong Xie, Hui Xiong

机构 * Information Hub, AI Thrust(信息中心,人工智能方向)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RQIQN方法,通过分位数估计视角改进分布性强化学习,解决分位数估计退化问题,提升风险敏感导航和Atari游戏性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06149 2026-05-08 cs.LG cs.AI 62%

AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning

AdaGamma:强化学习中时序适应的状态依赖折扣

Yaomin Wang, Jianting Pan, Ran Tian, Xiaoyang Li, Yu Zhang, Hengle Qin, Tianshu YU

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 AdaGamma通过学习状态依赖折扣函数和回报一致性目标,改进了深度强化学习中的状态依赖折扣方法,在连续控制基准和京东物流平台实现显著提升。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 62%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 62%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 62%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 62%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI 62%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏