DRM: Diffusion-based Reward Model With Step-wise Guidance
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
大厂专区
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
探索信息寻求智能体整合
机构 * Peking University(北京大学) ; Tencent(腾讯)
AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。