Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs
评估GRPO和DPO在LLM中的忠实链式推理能力
机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。