Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner
机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL
Comments EMNLP 2025 Main Conference