arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2602.01587 2026-02-03 cs.CL cs.AI 84%

Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment

通过噪声增强对齐的可证明防御框架对抗LLM劫持

Zehua Cheng, Jianwei Yang, Wei Dai, Jiahao Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04204 2026-02-03 cs.LG cs.CR stat.ML 83%

Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence

短长度对抗训练有助于LLMs防御长长度劫持攻击:理论和实证证据

Shaopeng Fu, Liang Ding, Jingfeng Zhang, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) The University of Sydney(悉尼大学) The University of Auckland(奥克兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出通过短长度对抗训练有效防御长长度劫持攻击,理论和实验证实了这种策略的可行性。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV 81%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00619 2026-02-03 cs.CL cs.AI cs.CR cs.LG 80%

Jailbreaking LLMs via Calibration

通过校准劫持大语言模型

Yuxuan Lu, Yongkang Guo, Yuqing Kong

机构 * Department of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过校准劫持大语言模型,提出一种新的聚合框架,提升攻击成功率并降低劫持成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 78%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00420 2026-02-03 cs.CV cs.AI cs.CR 77%

Text is All You Need for Vision-Language Model Jailbreaking

文本就是视觉-语言模型劫持所需

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04531 2026-02-03 cs.CL cs.AI cs.LG 75%

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

DP-Fusion: 令牌级差分隐私推理用于大语言模型

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。

Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02395 2026-02-03 cs.LG cs.AI cs.CR cs.MA 62%

David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning

大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持

Samuel Nellessen, Tal Kachman

机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。

Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01290 2026-02-03 cs.NI 50%

AOASS: Adaptive Obstacle-Aware Square Spiral Framework for Single-mobile Anchor-Based WSN Localization

AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位

Abdelhady Naguib

专题命中 越狱攻击 :safety(abstract)

AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏