Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。