Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
在阴影中引导:大型语言模型中激活空间攻击的因果放大
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出通过因果放大效应,利用激活空间攻击实现对大型语言模型行为的可控引导,展示了其在安全性和有效性上的贡献。
Comments 31 pages, 5 figures, 9 tables