CoCA: Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
CoCA:基于强化学习的文本到图像(T2I)扩散模型微调中的免费步骤级奖励
机构 * Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 针对RL驱动T2I扩散模型微调的奖励稀疏问题,提出CoCA信用分配框架,通过余弦相似度变化分配密集奖励,提升样本效率与泛化性且不损害原最优策略。