Scaling Evaluation-time Compute with Reasoning Models as Evaluators
通过推理模型作为评估器来提升评估时的计算能力
机构 * CMU(卡内基梅隆大学) ; UIUC(伊利诺伊大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; NEC Laboratories Europe(日本 NEC 欧洲实验室) ; Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)
AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。
Comments ACL 2026 Findings