Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking
流偏好优化中的流形漂移:奖励黑客的根本原因
机构 * Zhejiang University(浙江大学) ; Kuaishou Technology(快手科技) ; Westlake University(西湖大学)
AI总结 本文针对流偏好优化中流形漂移导致奖励黑客的问题,提出ThermoDPO及其加权变体,在玩具基准和SD3.5-M数据集上均取得优于FlowDPO等方法的性能。