Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees
判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断
机构 * Dalhousie University(达尔豪斯大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校) ; Emory University(埃默里大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL;language model(comments)
AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。
Comments Accepted at Conference on Language Modelling 2026