arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-19 至 2026-01-19 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2511.15304 2026-01-19 cs.CL cs.AI 86%

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

对抗性诗歌作为大型语言模型中的通用单轮绕过机制

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Marcello Galisai, Vincenzo Suriani, Olga Sorokoletova, Federico Sartore, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马Sapienza大学) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校) VU Amsterdam(阿姆斯特丹VU)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 对抗性诗歌被证明能有效绕过大型语言模型的安全机制,其攻击成功率显著高于传统方法,揭示了现有安全措施的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18100 2026-01-19 cs.CL cs.AI 73%

Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation

Panacea: 通过微调后扰动缓解大语言模型的有害微调

Yibo Wang, Tiansheng Huang, Li Shen, Huanjin Yao, Haotian Luo, Rui Liu, Naiqiang Tan, Jiaxing Huang, Dacheng Tao

机构 * Tsinghua University(清华大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Didichuxing Co. Ltd(滴滴出行有限公司) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 Panacea通过自适应扰动优化,在保持微调性能的同时缓解大语言模型的有害微调问题

Comments Accepted by NeruIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏