arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-07-29 至 2026-07-29 共收录 1
2607.24780 2026-07-29 cs.AI 新提交

LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

LivingArena:大语言模型知道其他大语言模型所不知道的吗?作为可扩展评估的对等探测

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 研究大语言模型能否利用其他模型的未知进行评估,提出自动化抗污染评估框架LivingArena,模型轮流提问,经评审验证,能产生稳定排行榜,可衡量事实严谨性等,与人类偏好相关性弱,提供低成本持续评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏