Step-wise Rubric Rewards for LLM Reasoning
分步评分奖励用于大语言模型推理
机构 * Peking University(北京大学) ; JD Explore Academy(京东探索学院) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG
AI总结 本文提出一种分步评分奖励方法,通过引入LLM判官对每个评分项进行归因,规范化每步评分,并结合优势估计器提高推理准确性和减少自我纠正循环。
Comments Code available at https://github.com/akarinmoe/SRaR