arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2601.10543 2026-02-02 cs.AI cs.CL 90%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18292 2026-02-02 cs.LG cs.AI 88%

TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment

TriPlay-RL:三角色自我对抗强化学习用于大语言模型安全对齐

Zhewen Tan, Wenhan Yu, Jianfeng Si, Tongxin Liu, Kaiqi Guan, Huiyan Jin, Jiawen Tao, Xiaokun Yuan, Duohe Ma, Xiangzheng Zhang, Tong Yang, Lin Sun

机构 * Peking University(北京大学) Qiyuan Tech(启元科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 TriPlay-RL通过三角色自我对抗强化学习,实现LLM安全对齐的高效且可扩展范式,提升攻击有效性、安全性能和评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09190 2026-02-02 cs.LG cs.AI 86%

Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining

多级安全连续投影:无需重新训练的微调大语言模型安全增强方法

Bing Han, Feifei Zhao, Dongcheng Zhao, Guobin Shen, Ping Wu, Yu Shi, Yi Zeng

机构 * Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知人工智能实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需重新训练的微调后安全增强方法MSCP,通过多级表示对齐和安全方向投影,有效抑制有害输出并提升与人类偏好的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23081 2026-02-02 cs.CL cs.AI cs.CR 84%

Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures

字符作为大语言模型中的潜在变量:对涌现偏差和条件安全失败的机制解释

Yanghao Su, Wenbo Zhou, Tianwei Zhang, Qiu Han, Weiming Zhang, Nenghai Yu, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :safety(title);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型中字符层面倾向对齐风险的核心机制,指出行为倾向的稳定转变是导致涌现偏差和安全失败的关键因素,而非单纯的能力退化或提示防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22240 2026-02-02 cs.CR cs.AI cs.CL cs.LG 82%

A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy

针对提示注入和劫持攻击的LLM防御措施系统文献综述:扩展NIST分类

Pedro H. Barcha Correia, Ryan W. Achjian, Diego E. G. Caetano de Oliveira, Ygor Acacio Maria, Victor Takashi Hayashi, Marcos Lopes, Charles Christian Miers, Marcos A. Simplicio

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统回顾了针对提示注入和劫持攻击的LLM防御措施,扩展了NIST分类,并提供了全面的防御目录和指南。

Comments 27 pages, 14 figures, 11 tables, submitted to Elsevier Computer Science Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22169 2026-02-02 cs.CL cs.AI cs.CR cs.LG 82%

In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

葡萄酒中的真理与漏洞:通过醉酒语言诱导检验LLM安全性

Anudeex Shetty, Aditya Joshi, Salil S. Kanhere

机构 * School of Computer Science and Engineering, UNSW Sydney(计算机科学与工程学院,新南威尔士大学悉尼分校) School of Computing and Information System, the University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过诱导LLM产生醉酒语言,研究其安全漏洞,发现其易受劫持攻击和隐私泄露,揭示了LLM安全性的潜在风险。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22398 2026-02-02 cs.CV cs.AI 77%

Jailbreaks on Vision Language Model via Multimodal Reasoning

通过多模态推理实现对视觉语言模型的逃逸攻击

Aarush Noheria, Yuguang Yao

机构 * Novi High School, MI, USA(诺维高中) Michigan State University, MI, USA(密歇根州立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23255 2026-02-02 cs.CL cs.AI cs.CR 73%

Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models

现在你能听见我:对抗大型音频-语言模型的音频叙述攻击

Ye Yu, Haibo Jin, Yaoning Yu, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Boise State University(博伊西州立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究提出了一种音频叙述攻击,通过在叙述式音频流中嵌入非法指令,成功绕过大型音频-语言模型的安全机制,验证了语音接口安全性的关键挑战。

Comments to be published at EACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏