Intention Analysis Makes LLMs A Good Jailbreak Defender
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
Comments COLING 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
Comments COLING 2025
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
Comments ongoing work
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL
Comments 10 pages, accepted at NeurIPS 2024
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title);safety(abstract);prompt injection(abstract);分类 cs.CL
专题命中 越狱攻击 :prompt injection(title);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 40 pages, 31 Figures
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(abstract);分类 cs.LG
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
Comments ICLR 2024
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL
大语言模型的越狱与漏洞缓解
机构 * Hunan University Changsha, PRC ; Georgia Institute of Technology Atlanta, USA ; Kyoto University Kyoto, Japan ; Purdue University West Lafayette, USA ; National Taiwan Normal University Taipei, ROC ; University of Liverpool Suzhou, PRC ; Hong Kong University of Science ; University of Hawaii Honolulu, USA ; The University of Texas at Dallas Dallas, USA ; University of Wisconsin-Madison Madison, USA ; Emory University Atlanta, USA ; College of William \& Mary Williamsburg, USA
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。
Journal ref Eureka 1(1) (2026) 26-61
Furina: 碎片化不确定性驱动的拒绝不稳定攻击
机构 * School of Intelligence Science and Technology(智能科学与技术学院) ; State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Nanjing University(南京大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 通过揭示大语言模型安全行为存在不稳定区域,提出多指标诊断框架并开发Furina攻击方法,利用碎片化场景提示诱导不确定性放大,实现高效越狱。
Comments This work is accepted as a regular paper at ICML 2026
层流假说:通过大语言模型中的语义湍流检测对抗性突破
机构 * Brac University(布拉克大学)
专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);trustworthy(abstract)
SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。
Journal ref ICML 2026
基于原子越狱策略解耦与组合的多模态自动红队评估
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
HarmRLVR: 利用可验证奖励进行有害大模型对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。