A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth
一种面向评委的排名框架:无需真实标签评估大语言模型
机构 * University of Technology Sydney(悉尼科技大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出一种面向评委的排名框架,通过引入评委特定的辨别参数扩展Bradley-Terry-Luce模型,在不参考标签的情况下联合估计潜在模型质量和评委可靠性,从而提高人类偏好的一致性,提高数据效率,并产生校准的不确定性量化。