In-Context Representation Hijacking
上下文表示劫持
机构 * Mentaleap ; Independent Researcher(独立研究者) ; UC Berkeley(加州大学伯克利分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Doublespeak通过替换有害关键词为无害标记,使模型内部表示收敛至有害语义,从而绕过安全对齐。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
上下文表示劫持
机构 * Mentaleap ; Independent Researcher(独立研究者) ; UC Berkeley(加州大学伯克利分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Doublespeak通过替换有害关键词为无害标记,使模型内部表示收敛至有害语义,从而绕过安全对齐。
SoK:面向大语言模型安全的综合因果分析框架
机构 * Singapore Management University(新加坡管理大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出一个综合因果分析框架,用于研究大语言模型安全问题,通过系统分析因果因素提升模型安全性。