arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-30 至 2026-07-30 共收录 2
2607.26191 2026-07-30 cs.AI cs.CL cs.LG cs.SE 新提交

Position: Evaluation Scores Are Perishable Knowledge Claims

Position: 评估分数是易逝的知识主张

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深度思考解决方案公司) Meta University of Florida(佛罗里达大学)

AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。

Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏