FENCE: A Financial and Multimodal Jailbreak Detection Dataset
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
智能体AI控制评估中的攻击选择显著降低安全性
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究攻击者策略性选择攻击时机对AI控制安全性的影响,通过分解攻击决策为开始和停止策略,实验表明两者均显著降低安全性,现有评估可能高估安全性。
SlotGCG:利用LLMs中的位置脆弱性进行越狱攻击
机构 * Dongguk University-Seoul(东国大学-首尔)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SlotGCG方法,通过量化提示中不同插入位置(槽)的脆弱性得分(VSS),选择最脆弱的位置插入对抗性令牌,从而显著提升基于优化的越狱攻击成功率。
Journal ref International Conference on Learning Representations (ICLR), 2026
大型语言模型的越狱缩放定律:多项式-指数交叉
机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) ; Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。
Mask-GCG:对抗性后缀中的所有标记对于越狱攻击都是必要的吗?
机构 * Politecnico di Milano(米兰理工学院) ; Beihang University(北京航空航天大学) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; AI Security Lab(360人工智能安全实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Mask-GCG方法,通过可学习的标记掩码识别后缀中高影响力标记并剪枝低影响力标记,降低计算开销并保持攻击成功率,揭示LLM提示中的标记冗余。
Comments Accepted to ICASSP 2026
Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 13887-13891, 2026
频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。
SafeRedirect:通过任务完成重定向击败内部安全崩溃在前沿大语言模型中
机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen 518055, China(南方科技大学计算机科学与工程系,深圳518055,中国) ; The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) ; George Washington University(乔治华盛顿大学) ; School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,香港,中国)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SafeRedirect,通过重定向模型任务完成驱动力来解决内部安全崩溃问题,有效降低不安全生成率,经多模型验证显示其在不同攻击类型中均表现出色。
Comments 13 pages, 4 figures, 3 tables. Code: https://github.com/fzjcdt/SafeRedirect
你的代理,他们的资产:OpenClaw的现实世界安全性分析
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; NUS(新加坡国立大学) ; Tencent(腾讯) ; ByteDance(字节跳动) ; UC Berkeley(加州大学伯克利分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。
Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破
机构 * University College London(伦敦大学学院)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。
大语言模型知其弱点:通过自然分布偏移揭示安全漏洞
机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) ; Beihang University(北京航空航天大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。
Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack
AudioJailbreak: 对端到端大音频-语言模型的攻击
机构 * Wuhan University(武汉大学) ; Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; State Key Laboratory of Cryptology(密码学国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing Institute of Software Technology(南京软件技术研究所) ; Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学) ; Zhejiang Lab(浙江实验室) ; Pengcheng Laboratory(鹏城实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。
Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)
迈向通用且可迁移的视觉-语言模型劫持攻击
机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) ; School of Information Technology, Deakin University, Australia(德肯大学信息科技系) ; Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。
Comments ICLR 2026
E$^2$AT: 通过动态联合优化实现多模态对抗防御
机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) ; HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。
针对集成大语言模型应用的提示注入攻击
机构 * Griffith University(格里菲斯大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Huazhong University of Science and Technology(华中科技大学) ; Indiana University at Bloomington(印第安纳大学布卢明顿分校) ; Southern University of Science and Technology(南方科技大学) ; Tianjin University(天津大学)
专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出HouYi技术,揭示LLM集成应用中提示注入攻击的潜在风险及缓解方法。
通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。
机构 * Department of Electrical, Computer ; Biomedical Engineering, University of Pavia, Italy\ . ; Department of Computer Applications,\ University of Science \& Technology, India\ .
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG
机构 * International Computer Science Institute, CA, USA(国际计算机科学研究所) ; Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG
机构 * Fan Yang
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
机构 * Scale AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG
Comments 19 pages
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA(NVIDIA公司) ; Cornell University(康奈尔大学) ; Washington University, St. Louis(圣路易斯华盛顿大学) ; University of Michigan, Ann Arbor(安娜堡大学) ; The Ohio State University(俄亥俄州立大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2025 Spotlight. Project Page: https://autodans.github.io/AutoDAN-Turbo Code: https://github.com/SaFoLab-WISC/AutoDAN-Turbo
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
Comments This paper has been submitted to Nature Machine Intelligence and OpenReview preprints. It has 7 pages of text, 3 figures, and 3 tables
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
Comments ICLR 2025
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments 18 pages, 13 tables, 6 figures
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
Comments Published at ICLR 2025