Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
Journal ref 38th Conference on Neural Information Processing Systems (NeurIPS 2024)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
Journal ref 38th Conference on Neural Information Processing Systems (NeurIPS 2024)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI
Comments Accepted at AAAI 2025
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
Comments Accepted by EMNLP 2024 Main
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
Comments Accepted by USENIX Security 2024
专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
Comments 13 pages, 6 figures
Journal ref The 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
Comments Published at Fourth Workshop on TrustworthyNLP (TrustNLP) at NAACL 2024
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI
Comments 18 pages, 9 figures, Accepted in ACL 2024
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
Comments Acccepted by NAACL 2024, 18 pages, 7 figures, 13 tables
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL
Comments Accepted by ICASSP 2024
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
Comments 11 pages
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
位置:AI安全政策应针对系统,而非模型
机构 * AI Safety Department(人工智能安全部门) ; SimulaMet and OsloMet(SimulaMet和奥斯陆计量)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。
自主性税:防御训练破坏LLM智能体
机构 * University of Southern California(南加州大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。
Patcher: 后门大型语言模型的事后修补
机构 * University of Louisville(路易斯维尔大学) ; University of North Texas(北得克萨斯大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。
Comments To appear in the USENIX Security Symposium, 2026
使用多片段视频破解多模态大语言模型
机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) ; Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。
Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026
失败的流形:语言模型中的行为吸引盆地
机构 * Amazon Web Services(亚马逊网络服务) ; Cisco(思科) ; Shrewd Security(精明安全)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于MAP-Elites的方法,用于系统地映射语言模型的失败流形,揭示不同模型的拓扑结构和漏洞分布。
面向角色的语言模型:用于组织中的安全且上下文化的访问控制
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Nazarbayev University(纳扎尔拜耶夫大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。
Comments AACL 2025 - Main