Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。
Comments Accepted by CVPR 2026