arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-10 至 2026-07-10 共收录 1
2607.08522 2026-07-10 cs.LG 新提交

Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data

停止猜测何时停止测试:用足够的数据进行高效模型评估

Ofir Arviv, Kristjan Greenewald, Yotam Perlitz, Hadar Mulian, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院)

AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏