Confidence as a Reward: Transforming LLMs into Reward Models
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI