Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning
挖掘还是合成?重新思考数学推理迭代对齐中的探索效率
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) ; Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) ; Huawei Multimodal Model Lab(华为多模态模型实验室) ; Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 针对数学推理任务中迭代DPO对齐时高N采样收益递减且引入噪声的问题,提出PACE框架,通过低预算探索与纠错合成偏好对,以约1/5计算量达到或超越高N基线性能。