arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-07-30 至 2026-07-30 共收录 1
2607.26191 2026-07-30 cs.AI cs.CL cs.LG cs.SE 新提交

Position: Evaluation Scores Are Perishable Knowledge Claims

Position: 评估分数是易逝的知识主张

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深度思考解决方案公司) Meta University of Florida(佛罗里达大学)

AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。

Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035

详情

展开后加载摘要…

URL PDF HTML 收藏