Homing through Reinforcement Learning
通过强化学习实现归巢
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
通过强化学习实现归巢
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。
从猜测到占位:一种基于代价理论的不确定性感知代码补全框架
机构 * Tencent, Shenzhen, China(腾讯深圳公司)
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。
TetraRL:面向设备上深度强化学习系统的自适应运行时
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。
Comments Extension version of RTSS'23 and RTSS'24
使用$\Delta$Search解决子图提取问题
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。
Comments 23 pages, 13 figures, 10 Tables
从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。
Comments 22 pages, 7 figures, Author list corrected
基于深度强化学习的六自由度行星powered着陆与着陆
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 本文提出了一种新型的集成引导与控制算法,利用强化学习原理学习策略,以实现精确且燃料高效的轨迹,同时通过不同的折扣率提升优化性能。
Comments 37 pages
基于概率模型预测控制的数据高效强化学习
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 本文提出基于概率模型预测控制的强化学习框架,通过高斯过程学习转移模型以处理约束,实现数据高效和最优控制。
Comments Accepted at AISTATS 2018,
一种用于规划与习惯控制系统的仲裁新模型
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本文提出一种结合规划与习惯控制的仲裁模型,通过模拟双关节机械臂任务展示其在动态环境中的高效性和鲁棒性。
基于采样式贝叶斯强化学习的同时主动参数估计与控制
专题命中 模仿学习与强化学习 :manipulation(abstract)
AI总结 本文提出利用蒙特卡洛树搜索和扩展卡尔曼滤波处理高斯过程噪声和参数不确定性,实现机器人任务中的同时估计与控制,通过比较确定性等价模型预测控制的仿真结果验证方法有效性。
短视策略界限用于信息获取POMDPs
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本文研究了机器人传感系统在环境监测、搜索救援和侦察等场景中的自主信息采集问题,通过部分可观测马尔可夫决策过程(POMDP)建模,提出基于短视计算的策略上下界方法,用于加速最优策略的求解。
Comments 8 pages, 3 figures
基于模型的路径积分随机控制:一种贝叶斯非参数方法
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 本文提出一种基于路径积分和高斯过程的模型驱动随机优化控制框架,通过有限样本数据自主学习时间变化的最优控制,提升高维复杂任务的控制效率。
训练扩散语言模型用于黑盒优化
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 针对离线黑盒优化问题,提出通过扩散语言模型的双向建模能力,结合统一语料构建和两阶段后训练框架,实现高效设计生成,在Design-Bench上达到最优性能。
Comments Accepted at ICML 2026 as a Spotlight Paper (top 2.2% of submissions)
ElasticMem: 将潜在记忆作为LLM智能体的可学习资源
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学)
专题命中 模仿学习与强化学习 :embodied agent(abstract)
AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。
R3DM:通过动态模型在多智能体强化学习中实现角色发现与多样性
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 R3DM通过动态模型最大化智能体角色、观察轨迹与预期未来行为间的互信息,提升多智能体协作效率,实验表明其在SMAC和SMACv2环境中显著提升胜率。
Comments 21 pages, To appear in the International Conference of Machine Learning (ICML 2025)
AgentGL: 通过强化学习实现基于LLM的代理图学习
机构 * New York University Shanghai(上海纽约大学) ; New York University(纽约大学) ; Tsinghua University(清华大学)
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 AgentGL通过强化学习框架实现图学习,结合图导航与LLM推理,提升复杂关系环境下的自主导航与推理能力,优于现有基线方法。
Comments ACL 2026 Main Conference
DRASTIC:一种面向6G网络切片的动态资源分配框架,用于任务感知闭环触觉互联网应用
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本文提出DRASTIC框架,通过强化学习动态分配资源,满足延迟要求并提高吞吐量,适用于eMBB和HRLLC用户。
通过强化学习进行递归效用下的投资组合优化
专题命中 模仿学习与强化学习 :world model(abstract)
AI总结 本文研究递归效用是否能提升投资组合分配的强化学习效果,通过蒙特卡洛方法近似递归效用中的确定等价,改进了PPO和A2C算法,实验显示在夏普比率、最大回撤和累计收益上优于传统方法。
基于无人机的化学烟雾源定位的多智能体强化学习
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 本研究提出基于多智能体深度强化学习的框架,用于无人机在化学烟雾源定位中的高效检测与精准定位。
迈向动态四足步态:基于对称性的强化学习层次结构实现自由步态转换于不同速度下
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升步态适应性。
自主代理的认知框架:迈向人机协同设计
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 本文提出一种融合经典条件反射与工具性学习的强化学习框架,以提升自主系统在未知环境中的决策效率与合作能力。
动态触觉传感系统与软演员评论强化学习用于包容体表征
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本文提出一种结合机器人触觉传感与软演员评论强化学习的动态触觉传感系统,用于精准定位和表征嵌入的包容体,实验表明其在尺寸估计精度上优于人工操作。
UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用
机构 * Meituan(美团) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Dalian University of Technology(大连理工大学)
专题命中 模仿学习与强化学习 :manipulation(abstract)
AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。
NeuRehab:一种基于强化学习和脉冲神经网络的康复自动化框架
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 NeuRehab通过结合强化学习和脉冲神经网络,实现康复自动化框架,优化功耗和延迟,提升神经形态部署性能。
Comments 18 pages, 22 figures, 3 tables, for submission to IOP Neuromorphic Computing and Engineering
在预训练、中训练和强化学习对推理语言模型的相互作用中
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)
专题命中 模仿学习与强化学习 :manipulation(abstract)
AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。
通过多智能体强化学习分析大规模混合交通控制中的碰撞率
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。
自适应与系统化控制策略在掺空Hubbard簇中的比较分析:强化学习与物理引导设计
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 本文比较了自主强化学习与物理引导设计在掺空Hubbard簇中的表现,证明自主RL在优化和策略发现中具有高效性和竞争力。
在随机和确定性设置中MPPI控制的最优性与次优性质
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 本文研究了MPPI控制在确定性系统中的次优性质,并通过调整超参数来调节其性能。
Comments 6 pages, 3 figures, submitted to LCSS with CDC25 option
MARL-CC:多智能体强化学习在连接自动驾驶车辆中的数学框架:解决非线性、部分可观测性和信用分配以实现最优控制
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 MARL-CC提出了一种统一的数学框架,通过整合微分几何控制、贝叶斯推断和夏普利值信用分配,解决多智能体强化学习中的非线性、部分可观测性和信用分配问题,提升收敛速度和协同效率。
LLM4Laser: 利用大语言模型自动化激光器设计
专题命中 模仿学习与强化学习 :robotics(abstract)
AI总结 本文提出利用大语言模型实现激光器设计自动化,通过对话生成仿真和强化学习代码,实现从概念到算法的全流程自动化设计。
Comments 14 pages, 10 figures
法律强度前沿与在波动率法律流形上寻求法律的强化学习的无免费午餐结果
专题命中 模仿学习与强化学习 :world model(abstract)
AI总结 本文研究了在波动率法律流形上强化学习的法律强度权衡及无免费午餐问题,通过实验揭示法律寻求RL在波动率建模中的局限性。
Comments 61 pages, 14 figures