arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2507.23465 2026-02-24 cs.CL cs.AI 79%

Role-Aware Language Models for Secure and Contextualized Access Control in Organizations

面向角色的语言模型:用于组织中的安全且上下文化的访问控制

Saeed Almheiri, Yerulan Kongrat, Adrian Santosh, Ruslan Tasmukhanov, Josemaria Loza Vera, Muhammad Dehan Al Kautsar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Nazarbayev University(纳扎尔拜耶夫大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。

Comments AACL 2025 - Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19396 2026-02-24 cs.AI 70%

Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement

明文之中隐藏:通过激活解耦检测隐蔽的 jailbreak

Amirhossein Farzam, Majid Behabahani, Mani Malek, Yuriy Nevmyvaka, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind) Apple(苹果公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 通过解耦 LLM 激活中的语义因子,提出 FrameShield 异常检测器,提升对隐蔽 jailbreak 的检测能力,并推动 LLM 安全和可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 67%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16789 2026-02-24 cs.CL cs.AI cs.LG 67%

Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards

意外漏洞:影响微调的因子

Punya Syon Pandey, Samuel Simko, Kellin Pelrine, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) FAR AI(FAR人工智能公司) McGill University(麦吉尔大学) MILA(蒙特利尔人工智能研究院) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏