Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning
通过基于梯度的强化学习引导分布匹配蒸馏
机构 * Zhejiang University(浙江大学) ; Bytedance Inc.(字节跳动公司) ; Zhejiang Lab(浙江实验室)
AI总结 本文提出GDMD框架,通过优先考虑蒸馏梯度而非原始像素输出来优化奖励机制,提升了少步生成的质量与稳定性,实验证明其在生成质量与人类偏好指标上均优于现有方法。