When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
当安全阻止感知:测量大语言模型拒绝中的语义混淆
机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出语义混淆的概念及测量框架,通过ParaGuard语料库和三种模型无关指标,揭示大语言模型拒绝中的局部不一致问题,帮助开发者优化安全与准确性平衡。