Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
停止猜测何时停止测试:用足够的数据进行高效模型评估
机构 * IBM Research(IBM研究院)
AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。
大厂专区
停止猜测何时停止测试:用足够的数据进行高效模型评估
机构 * IBM Research(IBM研究院)
AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。
丢弃少量偏好可以改变大型语言模型的排名
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
AI总结 研究通过评估LLM排名系统的鲁棒性,发现丢弃少量偏好数据可显著影响模型排名,揭示MT-bench偏好更稳定的原因。