2509.20293 2025-10-09 cs.LG cs.AI When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity Benjamin Feuer, Chiung-Yi Tseng, Astitwa Sarthak Lathe, Oussama Elachqar, John P Dickerson 机构 * Stanford University(斯坦福大学) ; SambaNova ; Mozilla AI(Mozilla人工智能) 纠错 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图