Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification
语义作为盾牌:对抗大语言模型情感分类中提示注入的标签伪装防御(LDD)
机构 * Department of Computer Science, George Washington University(计算机科学系,乔治华盛顿大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出LDD,一种通过语义伪装标签来防御大语言模型情感分类中提示注入攻击的方法,展示了其在不同模型上的有效性。