Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation
生成无奖励的评判标准以减少智能体评估中的过度打分
机构 * Trinity College Dublin(都柏林三一学院) ; University College Dublin(都柏林大学学院) ; Dublin City University(都柏林城市大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。