Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM
已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化
机构 * Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。