LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation
LivingArena:大语言模型知道其他大语言模型所不知道的吗?作为可扩展评估的对等探测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
AI总结 研究大语言模型能否利用其他模型的未知进行评估,提出自动化抗污染评估框架LivingArena,模型轮流提问,经评审验证,能产生稳定排行榜,可衡量事实严谨性等,与人类偏好相关性弱,提供低成本持续评估方法。