机构
*
Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学)
;
Khalifa University of Science and Technology(科技大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
FAIRGAMER:评估基于LLM的视频游戏NPC中的社会偏见
Bingkang Shi, Jen-tse Huang, Long Luo, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu, Xiaodan Zhang, Zhongjiang Yao
机构
*
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
超越功能正确性:探索LLM生成代码中的幻觉
Fang Liu, Yang Liu, Lin Shi, Zhen Yang, Li Zhang, Xiaoli Lian, Zhongqi Li, Yuchi Ma
机构
*
2 State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE) School of Computer Science
;
Engineering, Beihang University, Beijing, China
;
3 School of Software, Beihang University, Beijing, China
;
4 School of Computer Science
;
Technology, Shandong University, Qingdao, China
;
5 Huawei Cloud Computing Technologies Co., Ltd, China
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Tailored Emotional LLM-Supporter: Enhancing Cultural Sensitivity
定制情感LLM支持者:增强文化敏感性
Chen Cecilia Liu, Hiba Arnaout, Nils Kovačić, Dana Atzil-Slonim, Iryna Gurevych
机构
*
Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technische Universität Darmstadt(通用知识处理实验室(UKP实验室)计算机科学系和海斯曼人工智能中心(hessian.AI)德意志联邦人家电大学)
;
Department of Psychology, Bar-Ilan University(心理学系,巴伊兰大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions
EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝
Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li
机构
*
Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院)
;
Ant Group(蚂蚁集团)
;
Ant International(蚂蚁国际)
;
School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs
ThinkEval: 基于思维的知识图谱对 LLM 编辑中知识泄漏的实用评估
Manit Baser, Dinil Mon Divakaran, Mohan Gurusamy
机构
*
Electrical and Computer Engineering National University of Singapore(新加坡国立大学电子与计算机工程系)
;
A*STAR Institute for Infocomm Research (A*STAR I 2 R), Singapore(新加坡A*STAR信息与通信研究机构)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
National University of Singapore(国立新加坡大学)
;
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
The University of Chicago(芝加哥大学)
;
Rutgers University(罗格斯大学)
;
Columbia University(哥伦比亚大学)
;
New Jersey Institute of Technology(新泽西理工学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Efficient Inference for Noisy LLM-as-a-Judge Evaluation
高效噪声LLM-as-a-Judge评估
Yiqun T Chen, Sizhu Lu, Sijia Li, Moran Guo, Shengyi Li
机构
*
Departments of Biostatistics and Computer Science, Johns Hopkins University(生物统计学与计算机科学系,约翰霍普金斯大学)
;
Department of Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校)
;
Department of Biostatistics, University of California, Los Angeles(生物统计学系,加州大学洛杉矶分校)
;
Department of Biostatistics, Johns Hopkins University(生物统计学系,约翰霍普金斯大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG