Reparameterization Flow Policy Optimization
重参数化流策略优化
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出重参数化流策略优化方法,通过联合反向传播流生成过程和系统动力学,提升模型驱动强化学习的样本效率和探索能力。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
重参数化流策略优化
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出重参数化流策略优化方法,通过联合反向传播流生成过程和系统动力学,提升模型驱动强化学习的样本效率和探索能力。
以任务为导向的策略优化从不一致的运动先验
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文提出任务导向的运动先验框架,通过将模仿视为条件正则化器,提升任务性能并抑制有害模仿,验证了在嘈杂示范下的鲁棒性。
Comments Work requires further details and not complete yet
StepScorer: 通过分步评分与心理遗憾建模加速强化学习
机构 * INDEPENDENT RESEARCHER(独立研究者)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 StepScorer通过分步评分与心理遗憾建模,加速强化学习收敛,适用于连续控制任务和延迟反馈环境。
Comments 10 pages, 5 figures, 1 table
基于自适应线性路径模型的扩散
机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出LP-MBD和ALP-MBD,通过线性概率路径和强化学习提升扩散模型在机器人控制中的适应性和鲁棒性。
Comments ICRA 2026