arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-04-22 至 2026-04-22 共收录 1
2604.19009 2026-04-22 cs.LG cs.CV

Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning

通过基于梯度的强化学习引导分布匹配蒸馏

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Bytedance Inc.(字节跳动公司) Zhejiang Lab(浙江实验室)

AI总结 本文提出GDMD框架,通过优先考虑蒸馏梯度而非原始像素输出来优化奖励机制,提升了少步生成的质量与稳定性,实验证明其在生成质量与人类偏好指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏