arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2505.14607 2025-12-04 cs.CL cs.CR 85%

sudoLLM: On Multi-role Alignment of Language Models

sudoLLM: 关于语言模型的多角色对齐

Soumadeep Saha, Akshay Chaturvedi, Joy Mahapatra, Utpal Garain

机构 * ISI Kolkata(印度Kolkata ISI研究所) IRIT Toulouse(法国图卢兹 IRIT 研究所)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 sudoLLM通过注入用户偏见信号,实现多角色对齐的LLM,提升安全性和抗攻击能力。

Comments Accepted to EMNLP 2025 (findings)

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 366-384, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01513 2025-12-04 cs.CR cs.CV 82%

SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism

SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) Southwestern University of Finance and Economics(西南财经大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Tongji University(同济大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏