Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG