Benchmarks Saturate When The Model Gets Smarter Than The Judge
基准在模型比裁判更智能时达到饱和
机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) ; imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) ; School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)
AI总结 研究发现当模型比裁判更智能时,基准测试的准确性下降,强调了高质量数据集和可靠裁判的重要性。
Comments 17 pages, 10 figures, 3 tables