arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-14 至 2025-11-14 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2511.09880 2025-11-14 cs.CL cs.CR 88%

EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models

Jialin Wu, Kecen Li, Zhicong Huang, Xinfeng Li, Xiaofeng Wang, Cheng Hong

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments Accepted by IEEE Symposium on Security and Privacy (S&P) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14250 2025-11-14 cs.CL cs.AI cs.CR 86%

Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors

Yi Zhao, Youzhi Zhang

机构 * Department of Computing The Hong Kong Polytechnic University Hong Kong SAR, China Centre for Artificial Intelligence Robotics Hong Kong Institute of Science \& Innovation Chinese Academy of Sciences Hong Kong SAR, China

专题命中 越狱攻击 :jailbreak(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACSAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18638 2025-11-14 cs.CR cs.AI cs.CL 84%

Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation

Daniel Schwartz, Dmitriy Bespalov, Zhe Wang, Ninad Kulkarni, Yanjun Qi

机构 * Amazon Bedrock Science(亚马逊Bedrock科学) Drexel University(德雷塞尔大学) University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract,comments);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10519 2025-11-14 cs.CL cs.AI 84%

Say It Differently: Linguistic Styles as Jailbreak Vectors

Srikant Panda, Avinash Rai

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10088 2025-11-14 cs.LG cs.AI cs.CV 62%

eXIAA: eXplainable Injections for Adversarial Attack

Leonardo Pesce, Jiawen Wei, Gianmarco Mengaldo

机构 * Department of Mechanical Engineering National University of Singapore(机械工程系国立新加坡大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏