Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning
面向离线强化学习的带行为优势修正的扩散策略
机构 * School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University(南洋理工大学化学、化学工程与生物技术学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对离线强化学习中分布偏移导致的Q值估计偏差问题,提出带行为优势修正的扩散策略(DPBAC)算法,结合BAC-PE与扩散模型,在D4RL任务上实现优于SOTA的性能。