IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
IF-RewardBench:用于指令遵循评估的评判模型基准测试
机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) ; Zhipu AI(智谱AI) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 本文提出IF-RewardBench,一个全面的指令遵循元评估基准,通过构建偏好图评估评判模型的排序能力,揭示现有模型缺陷,并展示其在下游任务中的更强相关性。
Comments ACL 2026