GARDO: Reinforcing Diffusion Models without Reward Hacking
GARDO:无需奖励黑客的扩散模型强化
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Kuaishou Technology(快手科技) ; CUHK MMLab(港中文大学MMLab) ; The University of Edinburgh(爱丁堡大学)
AI总结 GARDO通过自适应正则化和多样性增强,有效缓解扩散模型中的奖励黑客问题,提升生成多样性与样本效率。
Comments 17 pages. Project: https://tinnerhrhe.github.io/gardo_project