Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
Jie Cheng, Gang Xiong, Ruixi Qiao, Lijun Li, Chao Guo, Junle Wang, Yisheng Lv, Fei-Yue Wang
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Tencent(腾讯)
;
Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院)
;
DeSci Center of Parallel Intelligence, Obuda University(并行智能德Sci中心,奥布达大学)
;
Research Center for Chinese Economics and Social Security, University of Chinese Academy of Sciences(中国经济社会安全研究中心,中国科学院大学)
;
Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
机构
*
School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学)
;
State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所)
;
Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)