Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs
评估GRPO和DPO在LLM中的忠实链式推理能力
机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。