arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-03 至 2025-11-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2510.27172 2025-11-03 cs.LG cs.AI 73%

Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler

Zixuan Hu, Li Shen, Zhenyi Wang, Yongxian Wei, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) University of Central Florida(佛罗里达大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27062 2025-11-03 cs.LG cs.AI 73%

Consistency Training Helps Stop Sycophancy and Jailbreaks

Alex Irpan, Alexander Matt Turner, Mark Kurzeja, David K. Elson, Rohin Shah

机构 * Google(谷歌)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26981 2025-11-03 cs.LG cs.AI 73%

Fine-Grained Iterative Adversarial Attacks with Limited Computation Budget

Zhichao Hou, Weizhi Gao, Xiaorui Liu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26847 2025-11-03 cs.CR cs.AI cs.CL cs.IT math.IT 73%

Broken-Token: Filtering Obfuscated Prompts by Counting Characters-Per-Token

Shaked Zychlinski, Yuval Kainan

机构 * JFrog

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00943 2025-11-03 cs.CR cs.AI 57%

LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring

Chloe Li, Mary Phuong, Noah Y. Siegel

机构 * University College London(伦敦大学学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏