The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal
角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析
机构 * Iowa State University(爱荷华州立大学) ; Meta
AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。
Comments Preprint