Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
评分轮盘:LLM作为裁判框架中的自不一致
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。
Comments Accepted at EMNLP 2025
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
评分轮盘:LLM作为裁判框架中的自不一致
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。
Comments Accepted at EMNLP 2025
无条件真实性:学习大语言模型的无条件不确定性
机构 * MBZUAI ; Skoltech(斯克利切夫斯基因工大学) ; AIRI ; ETH Zürich(苏黎世联邦理工学院) ; The University of Melbourne(墨尔本大学) ; FRC CSC RAS(俄罗斯科学院计算技术研究所)
AI总结 本文提出通过学习注意力特征来解决大语言模型生成过程中不确定性评分的难题,通过两阶段训练方法提升了选择性生成的效果,优于其他无监督和监督方法。
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing