Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference
对抗提示反转攻击:面向LLM协作推理的信息论方法
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。
Comments Preprint. 33 pages, 5 figures