arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2508.13246 2025-12-30 cs.CR cs.AI 85%

Involuntary Jailbreak: On Self-Prompting Attacks

强制性越狱:关于自我提示攻击

Yangyang Guo, Yangyan Li, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示了大型语言模型中一种新的漏洞,通过简单提示策略可强制越狱多数主流模型,促使重新评估防护机制的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23173 2025-12-30 cs.CR cs.AI 83%

EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion

EquaCode:通过方程求解和代码补全的多策略对抗大语言模型

Zhen Liang, Hai Huang, Zhengkui Chen

机构 * School of Computer Science and Technology, Zhejiang Sci-Tech University, Hangzhou, China(计算机科学与技术学院,浙江科技学院,杭州,中国)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 EquaCode通过方程求解和代码补全提出多策略对抗方法,有效提升大语言模型的鲁棒性。

Comments This is a preprint. A revised version will appear in the Proceedings of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05499 2025-12-30 cs.CR cs.AI cs.CL cs.SE 81%

Prompt Injection attack against LLM-integrated Applications

针对集成大语言模型应用的提示注入攻击

Yi Liu, Gelei Deng, Yuekang Li, Kailong Wang, Zihao Wang, Xiaofeng Wang, Tianwei Zhang, Yepang Liu, Haoyu Wang, Yan Zheng, Leo Yu Zhang, Yang Liu

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学) Indiana University at Bloomington(印第安纳大学布卢明顿分校) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HouYi技术,揭示LLM集成应用中提示注入攻击的潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10321 2025-12-30 cs.LG cs.AI cs.CL cs.CR 80%

AdvPrefix: An Objective for Nuanced LLM Jailbreaks

AdvPrefix: 一种面向 nuanced LLM 模型 jailbreak 的目标

Sicheng Zhu, Brandon Amos, Yuandong Tian, Chuan Guo, Ivan Evtimov

机构 * University of Maryland, College Park(马里兰大学 College Park分校) FAIR, Meta(Meta的FAIR)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdvPrefix 提出了一种新的目标,通过结合高预填充攻击成功率和低负对数似然来选择模型依赖的前缀,以提升 jailbreak 攻击的精确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22488 2025-12-30 cs.LG cs.CV 79%

Toward Real-World IoT Security: Concept Drift-Resilient IoT Botnet Detection via Latent Space Representation Learning and Alignment

迈向现实世界的物联网安全:通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测

Hassan Wasswa, Timothy Lynar

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测框架,有效解决传统方法在动态环境中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11938 2025-12-30 cs.CL cs.AI cs.LG 78%

Improving Large Language Model Safety with Contrastive Representation Learning

通过对比表征学习提升大语言模型安全性

Samuel Simko, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统最大计划) University of Toronto(多伦多大学)

专题命中 越狱攻击 :safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于对比表征学习的框架,通过三元组损失和对抗性难负样本挖掘提升大语言模型对对抗攻击的鲁棒性。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏