Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models
迈向可扩展的多任务强化学习与大决策模型
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
迈向可扩展的多任务强化学习与大决策模型
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。
通过MPC求解具有未来信息的马尔可夫决策过程
机构 * Norwegian University of Science and Technology(挪威科学技术大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。
Comments 6 pages, accepted to IFAC World Congress 2026
MinInter:在模仿学习的数据增强中最小化轨迹插值
机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) ; Pengcheng Laboratory(鹏城实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 提出MinInter方法,通过选择需要最少插值的源演示来生成高质量合成轨迹,在MimicGen基准的12个操作任务中显著提升数据生成成功率和策略成功率。
Comments Accepted by IEEE CASE 2026
时间行为树的奖励-佩特里网解释
机构 * University of Würzburg(维尔茨堡大学) ; German Aerospace Center (DLR)(德国航空航天中心)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 提出将时间行为树(TBT)转换为奖励-佩特里网(RPN)的方法,自动生成奖励函数,解决复杂长时域机器人任务中强化学习奖励设计难题,提高样本效率和学习可控性。
Comments 9 pages, 10 figures
几何熵:轨迹多样性在模仿学习中的利弊
机构 * InfoBodied AI Lab, The University of Hong Kong(香港大学信息体人工智能实验室) ; Transcengram
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 提出几何熵(H_G)量化演示轨迹的几何多样性,发现成功率与H_G呈倒U型关系,且最优熵随任务掌握度增加而降低,可用于数据集审计与校准。
Comments Accepted to IROS 2026. Project page: https://geometric-entropy.github.io/
多粒度注意力驱动的强化学习框架用于Web智能增强系统
机构 * Infinity Tech Group ; Gainwell Technologies ; Capital One ; Sunnyvale, CA, USA(美国硅谷) ; Department of Electronics and Communication Engineering(电子与通信工程系) ; Sona College of Technology(Sona科技学院) ; Independent Researcher(独立研究员) ; Salem, India(印度塞拉姆)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 提出MGAR-WIES框架,通过语义图建模、注意力机制和自适应强化学习,解决Web环境中异构动态数据的语义理解与可扩展性问题,在准确率上达到80%。
Comments 2026 3rd International Conference on Integrated Intelligence and Communication Systems (ICIICS), 6 Pages
恢复、发现、规划:从机器人失败中学习技能与概念
机构 * CMU(卡内基梅隆大学) ; Princeton(普林斯顿大学) ; AI2(艾伦人工智能研究所) ; MIT(麻省理工学院) ; Centaur AI ; Bosch Center for AI(博世人工智能中心)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 提出ReSYNC方法,通过技能学习与概念发现的交替过程,从失败恢复经验中逐步构建抽象谓词,实现全局失败避免和长期规划,性能提升超50%。
Comments 9 pages, 6 figures. Website: https://jaraxxus-me.github.io/ReSYNC/
潜空间强化学习用于食品断裂模拟中的逆材料估计
机构 * University of Waterloo(滑铁卢大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 针对食品断裂模拟中材料参数难以直接测量的问题,提出基于潜空间强化学习的目标条件策略,实现从断裂行为描述到材料参数的单次前向估计,精度提升23%。
Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 MetaFood Workshop
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 9573-9581
CSPO: 面向安全强化学习的约束敏感策略优化
机构 * University of Luxembourg(卢森堡大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 提出约束敏感策略优化(CSPO),通过引入局部约束敏感性修正原目标,加速安全恢复并减少振荡,在导航与运动基准上取得更高约束回报。
Comments Accepted as a Spotlight paper at the 43rd International Conference on Machine Learning (ICML 2026)
InterleaveThinker: 强化智能体交错生成
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; Meituan(美团) ; CUHK IMIXR(香港中文大学IMIXR实验室)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。
Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker
通过多样化经验扩展视觉-语言-动作模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.CV
AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。
Comments ICML 2026, SyVLA
自回归强化学习策略中LTLf约束的神经符号注入
机构 * Sapienza University of Rome(罗马大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 提出神经符号框架,将LTLf约束编译为DFA并通过可微损失注入Transformer策略,在导航任务中提升约束满足且保持回报竞争力。
Comments Accepted at the Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs (SKILLED-LLMs 2026), co-located with KR 2026 and FLoC 2026, Lisbon, Portugal
SynthICL: 基于合成数据的可扩展上下文模仿学习
机构 * The Robot Learning Lab(机器人学习实验室) ; Imperial College London(伦敦帝国理工学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 提出SynthICL框架,利用纯RGB合成数据训练上下文模仿学习策略,避免深度传感和真实数据,通过子目标预测提升控制精度,在16个真实操作任务中平均成功率79%。
线性嵌入空间中的强化学习解锁软体机器人配置的通用控制
机构 * National University of Defense Technology(国防科技大学) ; Hefei University of Technology(合肥工业大学) ; Nanjing University (Suzhou Campus)(南京大学(苏州校区)) ; Technical University of Munich(慕尼黑工业大学) ; Beihang University(北京航空航天大学) ; Newcastle University(纽卡斯尔大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO
AI总结 提出基于共享线性Koopman嵌入空间的强化学习框架,将控制策略与机器人形态解耦,实现跨33种软体机器人配置的快速迁移,样本量减少75倍,并支持高速运动、重载和多执行器故障下的鲁棒控制。
Comments An updated version of this paper has been accepted by Nature Communications
基于多智能体强化学习的协作长绳跳绳
机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Beijing Academy of Artificial Intelligence, BAAI(北京智源人工智能研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 提出Marope框架,采用分层强化学习实现多个人形机器人的协作长绳跳绳,通过多智能体强化学习训练分散的摇绳策略,上层调度策略协调执行,并融入多样跳跃策略提升泛化能力,在仿真和真实实验中优于基线方法。
野外四足机器人的敏捷感知多技能运动
机构 * Agency for Defense Development(国防发展局) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; DIDEN Robotics(迪登机器人公司) ; Korea University(韩国大学)
专题命中 模仿学习与强化学习 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)
AI总结 研究使四足机器人在复杂地形实现多技能运动的问题,提出 APT-RL 框架,利用机载感知和计算自主转换技能,通过轨迹优化生成数据集训练技能,经实验验证该框架能让机器人在复杂环境敏捷机动,稳健穿越多样障碍物。
Comments Project page: https://skillquadsr.github.io/ ,This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science Robotics on 7.15.2026; doi: 10.1126/scirobotics.adz7397. Jun-Gill Kang and Jaehyun Park are co-first authors. Seungwoo Hong and Hae-Won Park are co-corresponding authors
强化学习在欧洲核子中心质子同步加速器(CERN PS)LHC束流优化中的应用
专题命中 模仿学习与强化学习 :manipulation(abstract)
AI总结 本研究将卷积神经网络与Soft-Actor-Critic强化学习智能体结合,实现CERN PS纵向三重分裂的自动化优化,其2025年部署的自主控制器为CERN注入器复合体首批强化学习束流质量优化系统之一。
Comments 15 pages, 14 figures, pre-print
随机微分方程引导的蒙特卡罗强化学习:一种用于噪声环境中稳健决策的随机最大值原理方法
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 研究探讨SMP定性最优条件能否指导稳健表格型强化学习算法,提出SDE-MC-AC框架,通过建立对应关系及自适应温度调度整合多种方法,经实验验证了相关假设,揭示导航模式,为随机最优控制与强化学习搭建桥梁。
搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Québec AI Institute(米拉-魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Halmstad University College(哈尔姆斯塔德大学学院)
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。
基于强化学习的随机多智能体系统最优事件触发分布式控制
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 针对含随机不确定性的多智能体系统,提出基于强化学习的最优分布式控制算法,采用 actor-critic-identifier 结构,用低通滤波器和混合事件触发控制策略,经稳定性证明,在仿真中验证正确性并与非最优算法比较突出优势。
基于深度强化学习的数字孪生自动隐身磨损攻击
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。
基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。
Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs
自适应智能体群体中的集体学习理论
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。
基于失败的深度强化学习智能体测试方法
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。
Comments 22 pages
TetraRL:面向设备上深度强化学习系统的自适应运行时
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。
Comments Extension version of RTSS'23 and RTSS'24
使用$\Delta$Search解决子图提取问题
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。
Comments 23 pages, 13 figures, 10 Tables