Can Optimal Transport Improve Federated Inverse Reinforcement Learning?
最优传输能否改进联邦逆强化学习?
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出基于最优传输的联邦逆强化学习方法,通过Wasserstein均值融合提升跨异构环境的奖励估计一致性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
最优传输能否改进联邦逆强化学习?
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出基于最优传输的联邦逆强化学习方法,通过Wasserstein均值融合提升跨异构环境的奖励估计一致性。
从积木到规划:通过强化学习在LLMs中实现多步骤空间推理
机构 * Department of Computer Science(计算机科学系)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。
区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击
机构 * Artificial Intelligence Northeastern University(人工智能东北大学) ; Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG
AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。
Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust
从人类反馈强化学习的综述
机构 * LMU Munich(慕尼黑大学) ; MCML Munich(慕尼黑马克斯·普朗克研究所) ; DFKI(德国人工智能研究中心)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。
Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b
Journal ref Transactions on Machine Learning Research, 2025
InDRiVE: 通过潜在分歧进行无奖励世界模型预训练以实现自动驾驶
机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学-迪尔伯恩分校)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO
AI总结 InDRiVE通过潜在分歧进行无奖励世界模型预训练,提升了自动驾驶在零样本迁移和少量样本适应中的鲁棒性。
超越特权:将密集奖励知识蒸馏到稀疏奖励策略中
机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO
AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。
动态环境中的演示引导持续强化学习
机构 * School of Computer Science, University of Galway(Galway大学计算机科学学院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本研究提出演示引导持续强化学习(DGCRL),通过外部演示库指导智能体探索与适应,提升动态环境中的学习效率和知识迁移能力。
GeoVista: 基于网络增强的代理视觉推理用于地理定位
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文元) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。
进入虚无 - 在奖励稀缺时规划以寻求熵
机构 * Department of Computer Science University of Exeter(计算机科学系埃克塞特大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 本文提出了一种基于世界模型的分层规划方法,在奖励稀缺时主动寻找信息丰富的状态,提升样本效率,应用于Dreamer时在迷宫任务中效率提升50%。
Comments 10 pages without appendix, 15 Figures, preprint
PrivORL: 用于离线强化学习的差分隐私合成数据集
机构 * University of Virginia(弗吉尼亚大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 PrivORL通过差分隐私技术合成离线强化学习数据集,利用扩散模型和好奇心驱动预训练提升合成数据的多样性和保真度。
Comments Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL
迈向便携视觉:基于视觉的主动视角选择
机构 * KAIST(韩国科学技术院)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.CV
AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。
Comments Project page: https://active-view-selection.github.io/
MPC引导的安全强化学习与基于Lipschitz的过滤用于结构非线性系统
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO
AI总结 本文提出结合MPC与RL的框架,通过安全控制边界和Lipschitz过滤器实现结构非线性系统的安全可控性。
均衡策略泛化:一种用于追捕-躲避游戏跨图零样本泛化的强化学习框架
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Dalian University of Technology(大连理工大学) ; Università della Svizzera italiana(瑞士意大利大学) ; Politecnico di Milano(米兰理工学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出EPG框架,通过均衡策略训练实现追捕-躲避游戏中跨图零样本泛化的高效解决方案。
从' thumbs up '到' 10 分之 10 ':重新考虑交互强化学习中的标量反馈
机构 * Tufts University School of Engineering, Computer Science(塔夫茨大学工程学院计算机科学系) ; Tufts University School of Engineering, Mechanical Engineering(塔夫茨大学工程学院机械工程系)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出STEADY方法,通过处理标量反馈提升机器人抓取任务中的学习效果,证明标量反馈在适当处理下对强化学习有益。
Journal ref IROS 2023
学习何时切换:通过强化学习实现自适应策略选择
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。
Comments 7 pages
基于对应关系的模仿学习:具有3D条件的灵活视觉-运动控制
机构 * Cornell University(康奈尔大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 COIL是一种基于对应关系的模仿学习框架,通过灵活的3D条件策略实现视觉-运动控制,能够适应不同任务需求并优于现有方法。
ContactRL: 基于接触的人机协作中的安全强化学习运动规划
机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 ContactRL通过力反馈强化学习实现安全高效的物理协作,提升人机协作任务的安全性和效率。
Comments 8 pages, 7 figures
基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发
机构 * Purdue University(普渡大学) ; Beijing University of Chemical Technology(北京化工大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Sungkyunkwan University(成均馆大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。
在策略优化中最优性与对抗鲁棒性之间的张力
机构 * School of Mathematical Sciences University of Chinese Academy of Sciences(中国科学院大学数学科学学院) ; School of Mathematical Sciences Nankai University(南开大学数学科学学院) ; School of Statistics and Data Science Nankai University(南开大学统计与数据科学学院) ; Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文提出 BARPO 框架,通过调节对手强度统一 SPO 和 ARPO,解决策略优化中最优性与对抗鲁棒性之间的张力问题。
基于强化学习的滑翔弹体引导与控制
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO
AI总结 本文提出利用强化学习提升滑翔弹体在动态环境中的自主导航与高精度目标跟踪能力。
Comments 6 pages
多智能体条件扩散模型与均场通信作为无线资源分配规划器
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) ; Department of Engineering, King’s College London(伦敦国王学院工程系)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。
基于交互式组间比较的强化学习从人类反馈中学习
机构 * Aalto University(阿尔托大学) ; University of Cambridge(剑桥大学) ; University of Trento(特伦特大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。
Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum
staggered 环境重置提升大规模并行 on-policy 强化学习
机构 * Harvard University(哈佛大学) ; UC San Diego(圣迭戈大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度
能量成本与神经复杂性在变化环境中的演变
机构 * University of Cape Town(开普敦大学) ; INRS Montreal(蒙特利尔INRS) ; NiTheCS
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI
AI总结 本研究通过演进人工神经网络探讨环境变化和能量成本如何影响神经复杂性进化,发现高季节性环境限制大脑大小,支持昂贵大脑假说。
Comments Presented at ALIFE 2025, proceedings forthcoming (MIT Press)
ReAlign:通过步感知奖励引导对齐实现文本到动作生成
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV
AI总结 ReAlign通过步感知奖励模型和引导策略提升文本到动作生成的对齐和质量。
Comments Accepted by AAAI 2026
梦之鹰:用于四旋翼的物理引导模型基强化学习
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO
AI总结 本文提出一种基于物理引导的世界模型方法,用于改进四旋翼的强化学习性能,通过物理模型预测力矩和状态展开,提升动态环境下的鲁棒性。
基于文本的决策代理:从自然语言监督中进行离线元强化学习
机构 * Nanjing University(南京大学) ; University of Technology Sydney(悉尼大学) ; The Chinese University of Hong Kong(香港中文大学) ; Australian National University(澳大利亚国立大学) ; University of New South Wales(新南威尔士大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 本文提出T2DA,通过自然语言监督实现离线元强化学习,利用文本-决策预训练提升零样本泛化能力。
Comments 32 pages, 8 figures
通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟
机构 * X-Humanoid ; Imperial College London(帝国理工学院) ; Peking University(北京大学) ; University of Manchester(曼彻斯特大学) ; Westlake University(西湖大学) ; Fudan University(复旦大学) ; Waseda University(早稻田大学) ; Nvidia ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Celonis AI ; Meta AI
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI
AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。
SkyRL-Agent: 多轮长周期LLM代理高效强化学习训练
机构 * NovaSky AI ; UC Berkeley(加州大学伯克利分校) ; Anyscale
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 SkyRL-Agent通过高效异步调度和工具增强训练配方,实现多轮长周期LLM代理的高效强化学习训练,使SA-SWE-32B在SWE-Bench上达到39.4% Pass@1,成本降低超2倍。
机构 * Sun Yat-sen University(中山大学) ; South China University of Technology(华南理工大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; City University of Hong Kong(香港城市大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO