Aligning Deep Implicit Preferences by Learning to Reason Defensively
通过防御性推理对齐深度隐式偏好
机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。
Journal ref ICLR 2026 Conference