arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2510.05052 2026-02-04 cs.CR cs.CL 85%

Proactive defense against LLM Jailbreak

主动防御对抗大语言模型劫持

Weiliang Zhao, Jinjun Peng, Daniel Ben-Levi, Zhou Yu, Junfeng Yang

机构 * Department of Computer Science, Columbia University, US(计算机科学系,哥伦比亚大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ProAct通过主动误导劫持方法,显著降低攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14103 2026-02-04 cs.CR cs.AI cs.LG cs.SD eess.AS 81%

AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models

AudioJailbreak: 对端到端大音频-语言模型的攻击

Guangke Chen, Fu Song, Zhe Zhao, Xiaojun Jia, Yang Liu, Yanchen Qiao, Weizhe Zhang, Weiping Tu, Yuhong Yang, Bo Du

机构 * Wuhan University(武汉大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Cryptology(密码学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Institute of Software Technology(南京软件技术研究所) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02595 2026-02-04 cs.CR cs.AI cs.CY 73%

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

为抵御网络攻击,我们必须教AI代理黑客

Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

机构 * Monash University(墨尔本大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文主张AI代理驱动的网络攻击不可避免,需转变防御策略,提出构建全面基准、发展训练代理发现漏洞及实施治理限制进攻性AI能力,以负责任地掌握进攻性AI能力作为防御基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 57%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03489 2026-02-04 cs.CR 50%

Detecting and Explaining Malware Family Evolution Using Rule-Based Drift Analysis

基于规则的漂移分析检测和解释恶意软件家族演变

Olha Jurečková, Martin Jureček

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出基于规则的漂移分析方法,用于检测和解释恶意软件家族演变,通过比较规则集识别特征变化,提供可操作的恶意软件行为洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏