When Wording Steers the Evaluation: Framing Bias in LLM judges
当用词引导评估:在LLM评估中框架偏见的影响
Yerin Hwang, Dongryeol Lee, Taegwan Kang, Minwoo Lee, Kyomin Jung
机构
*
IPAI, Seoul National University(IPAI,首尔国立大学)
;
Dept. of ECE, Seoul National University(电子工程系,首尔国立大学)
;
LG AI Research(LG人工智能研究)
;
SNU-LG AI Research Center(SNU-LG人工智能研究中心)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
;
Emory University(埃默里大学)
;
University of Minnesota(明尼苏达大学)
;
University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)
;
UMass Chan Medical School(UMass Chan医学学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
DataArc Tech Ltd.(DataArc科技有限公司)
;
IDEA Research, International Digital Economy Academy(国际数字经济学院IDEA研究所)
;
School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科学院)
;
State Key Lab of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Deployability-Centric Infrastructure-as-Code Generation: Fail, Learn, Refine, and Succeed through LLM-Empowered DevOps Simulation
以部署为中心的基础设施即代码生成:通过LLM赋能的DevOps模拟实现失败、学习、细化和成功
Tianyi Zhang, Shidong Pan, Zejun Zhang, Zhenchang Xing, Xiaoyu Sun
机构
*
Australian National University Canberra Australia
;
New York University \& Columbia University USA
;
Nanyang Technological University Singapore
;
Australian National University Australia
;
Australian National University
;
New York University \& Columbia University
;
Nanyang Technological University
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院)
;
Tata Medical Center(塔塔医学中心)
;
All India Institute of Medical Sciences(全印度医学科学研究所)
;
National Cancer Institute(国家癌症研究所)
;
Banaras Hindu University(巴纳尔斯·胡斯·印度大学)
;
Aster Malabar Institute of Medical Sciences(Aster马拉巴医学科学研究所)
专题命中
评测与基准
:language model(title,abstract);small language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity
超越完美API:对LLM代理在现实API复杂性下的全面评估
Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo
机构
*
Amazon(亚马逊公司)
;
KAIST(韩国科学技术院)
;
University of Pittsburgh(匹兹堡大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
University of Manchester(曼彻斯特大学)
;
Queen Mary University of London(伦敦大学玛丽女王学院)
;
Hongkong University of Science and Technology(香港科学与技术大学)
;
Nanjing University(南京大学)
;
Dartmouth College(达特茅斯学院)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI
Hybrid LLM-Enhanced Intrusion Detection for Zero-Day Threats in IoT Networks
混合LLM增强的物联网网络零日威胁入侵检测
Mohammad F. Al-Hammouri, Yazan Otoum, Rasha Atwa, Amiya Nayak
机构
*
Dept. of Computer Engineering, The Hashemite University(计算机工程系,哈希米大学)
;
School of Computer Science and Technology, Algoma University(计算机科学与技术学院,阿尔戈马大学)
;
College of Computer Science and Engineering, University of Jeddah(计算机科学与工程学院,朱德赫大学)
;
School of Electrical Engineering and Computer Science, University of Ottawa(电气工程与计算机科学学院,渥太华大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Journal refProc. IEEE/ACIS International Conference on Software Engineering, Artificial Intelligence, Networking and Parallel/Distributed Computing (SNPD), 2025, pp. 864-869