Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification
基于大语言模型的分类置信度估计中的评估缺陷与稀疏性限制
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) ; Amazon(亚马逊公司)
AI总结 该研究指出 LLM 分类置信度估计中 verbalization 方法存在稀疏性缺陷,AUARC 评估的插值选择会影响排名,提出 verbalization logprobs 方法可解决稀疏性并提升 AUARC 且无额外推理成本。
Comments Published at Findings of ACL 2026
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 33424-33435