Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations
LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer
机构
*
Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系)
;
Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系)
;
Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系)
;
Martian Research, San Francisco, California, USA(火星研究公司)
;
Apart Research, San Francisco, California, USA(Apart研究公司)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)