arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2511.19218 2025-11-27 cs.CR cs.AI 88%

Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization

对抗攻击-防御共演进用于LLM安全对齐的树组双感知搜索与优化

Xurui Li, Kaisong Song, Rui Zhu, Pin-Yu Chen, Haixu Tang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学) IBM Research AI(IBM人工智能研究) Indiana University(印第安纳大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI

AI总结 ACE-Safety通过树组双感知搜索与优化,共同优化攻击与防御模型,提升LLM的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02833 2025-11-27 cs.CR 85%

Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs

通过过拟合攻击:10次良性微调以劫持LLMs

Zhixin Xie, Xurui Song, Jun Luo

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 通过10个良性QA对微调实现LLM劫持,利用过拟合增强敏感性,提升攻击效果与隐蔽性。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18581 2025-11-27 cs.CR 78%

TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization

TASO:通过替代模板和后缀优化实现对抗性攻击

Yanting Wang, Runpeng Geng, Jinghui Chen, Minhao Cheng, Jinyuan Jia

专题命中 越狱攻击 :jailbreak(title,abstract)

AI总结 TASO通过交替优化模板和后缀,提高对抗性攻击的有效性,针对多种大语言模型进行测试并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14070 2025-11-27 cs.CR cs.AI 57%

Special-Character Adversarial Attacks on Open-Source Language Model

特殊字符对抗攻击对开源语言模型的攻击

Ephraiem Sarabamoun

机构 * University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了针对开源语言模型的特殊字符对抗攻击,评估了多种攻击方式并揭示了模型的安全漏洞及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏