Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
停止猜测何时停止测试:用足够的数据进行高效模型评估
机构 * IBM Research(IBM研究院)
AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。
大厂专区
停止猜测何时停止测试:用足够的数据进行高效模型评估
机构 * IBM Research(IBM研究院)
AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。