Distribution Matching Distillation Meets Reinforcement Learning
分布匹配蒸馏与强化学习的结合
机构 * HKUST(香港科技大学) ; Alibaba Group(阿里巴巴集团) ; SIAT, CAS(中国科学院深圳先进技术研究院) ; Shanghai AI Lab(上海人工智能实验室) ; ZJUT(浙江工业大学) ; CUHK(香港中文大学)
AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。
Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr