arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

2026-01-01 至 2026-01-01 共收录 1
2512.24138 2026-01-01 cs.LG cs.AI cs.CV

GARDO: Reinforcing Diffusion Models without Reward Hacking

GARDO:无需奖励黑客的扩散模型强化

Haoran He, Yuxiao Ye, Jie Liu, Jiajun Liang, Zhiyong Wang, Ziyang Yuan, Xintao Wang, Hangyu Mao, Pengfei Wan, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) CUHK MMLab(港中文大学MMLab) The University of Edinburgh(爱丁堡大学)

AI总结 GARDO通过自适应正则化和多样性增强,有效缓解扩散模型中的奖励黑客问题,提升生成多样性与样本效率。

Comments 17 pages. Project: https://tinnerhrhe.github.io/gardo_project

详情

展开后加载摘要…

URL PDF HTML 收藏