arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-04-29 至 2026-04-29 共收录 2
2510.27106 2026-04-29 cs.CL

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

评分轮盘:LLM作为裁判框架中的自不一致

Rajarshi Haldar, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10692 2026-04-29 cs.CL

Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models

无条件真实性:学习大语言模型的无条件不确定性

Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

机构 * MBZUAI Skoltech(斯克利切夫斯基因工大学) AIRI ETH Zürich(苏黎世联邦理工学院) The University of Melbourne(墨尔本大学) FRC CSC RAS(俄罗斯科学院计算技术研究所)

AI总结 本文提出通过学习注意力特征来解决大语言模型生成过程中不确定性评分的难题,通过两阶段训练方法提升了选择性生成的效果,优于其他无监督和监督方法。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏