Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
扩散引导的不确定性感知延迟策略优化
机构 * The Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai, China(能源化工过程智能制造重点实验室,教育部,东华大学,上海,中国) ; The School of Mathematics, East China University of Science and Technology, Shanghai, China(东华大学数学学院,上海,中国)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对现实环境强化学习因延迟反馈性能严重下降问题,提出DUPO方法。用扩散模型明确延迟状态与当前状态关系,利用差异估计加权延迟策略,实验表明该方法优于现有方法。
Comments Preprint; appendices included