Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)