TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; University of Alberta(阿尔伯塔大学) ; California Institute of Technology(加州理工学院) ; School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)
Comments 10 figures, 7 tables