Characterizing, Evaluating, and Optimizing Complex Reasoning
表征、评估与优化复杂推理
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) ; University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) ; Nanjing University, Suzhou, Jiangsu, China(南京大学) ; Peking University, Beijing, China(北京大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出ME$^2$原则来表征推理质量,基于有向无环图(DAG)的成对评估方法,并构建TRM-Preference数据集训练Thinking Reward Model(TRM),以优化推理过程。
Comments Code and data are available at https://github.com/Simplified-Reasoning/TRM