arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-19 至 2026-02-19 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2501.16534 2026-02-19 cs.CR cs.AI 90%

Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs

针对对齐:提取对齐LLM的安全分类器

Jean-Charles Noirot Ferrand, Yohan Beugin, Eric Pauley, Ryan Sheatsley, Patrick McDaniel

机构 * 2 Department of Computer Science Virginia Tech Blacksburg, VA, USA

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种提取对齐LLM安全分类器的方法,通过构建候选分类器并评估其在对抗性攻击中的有效性,展示了替代分类器在提高攻击成功率方面的优势。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16520 2026-02-19 cs.CR cs.AI 79%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 75%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15001 2026-02-19 cs.LG 70%

Boundary Point Jailbreaking of Black-Box LLMs

黑盒大语言模型的边界点劫持

Xander Davies, Giorgi Giglemiani, Edmund Lau, Eric Winsor, Geoffrey Irving, Yarin Gal

机构 * UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML、牛津大学)

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.LG

AI总结 BPJ是一种全新的黑盒自动化劫持攻击方法,通过边界点选择策略有效突破宪法分类器和GPT-5输入分类器的防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 57%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏