Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models
探索还是收敛?面向扩散模型的阶段引导式逐步优化方法
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。