Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries
语言模型是否知道何时会拒绝?探测安全边界内的自我意识
机构 * Purdue University(普渡大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。
Comments 11 pages, 5 figures