When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效
机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) ; CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) ; School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。