arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-31 cs.CV cs.MM 版本更新 82%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 79%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27504 2026-08-31 cs.CR 新提交 75%

Circuit Discovery Helps Detect LLM Jailbreaking: A Mechanistic Interpretability Study

电路发现助力检测大语言模型越狱:一项机制可解释性研究

Paria Mehrbod, Boris Knyazev, Guy Wolf, Eugene Belilovsky, Geraldin Nanfack

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究通过机制可解释性分析,在LLaMA-2-7B-chat-hf中识别出负责越狱响应的关键计算电路,剪枝这些电路可降低80%攻击成功率,为对齐LLMs的防御提供了可解释的新方向。

Comments Accepted at the 2nd Workshop on Reliable and Responsible Foundation Models of the 42nd International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 57%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27658 2026-08-31 cs.CL 新提交 57%

When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

当分词器失效:面向低资源语言零样本迁移的字节级分块方法

Sanjeev Kumar, Atsuki Yamaguchi, Nikolaos Aletras

机构 * IIT Bombay(印度理工学院孟买分校) University of Sheffield(谢菲尔德大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文针对低资源语言处理中字节级模型的粒度不匹配问题,提出适配的分层网络框架,通过初始化字节嵌入、分块对齐损失及词性监督,在六种语言的词性标注任务上实现最高13.3%的性能提升。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27531 2026-08-31 cs.CR cs.CV 新提交 50%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 越狱攻击 :safety(abstract)

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏