arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-06 至 2026-02-06 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2602.04893 2026-02-06 cs.LG cs.AI cs.CR 84%

A Causal Perspective for Enhancing Jailbreak Attack and Defense

从因果视角提升对抗攻击与防御

Licheng Pan, Yunsheng Lu, Jiexi Liu, Jialing Tao, Haozhe Feng, Hui Xue, Zhixuan Chu, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) University of Chicago(芝加哥大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Causal Analyst框架,通过因果分析提升大语言模型的对抗攻击与防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04896 2026-02-06 cs.CR cs.AI 83%

Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models

转向外部性:良性激活转向无意中增加大语言模型的劫持风险

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Ching-Yun Ko, Tsung-Yi Ho

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了大语言模型中良性激活转向对安全性的负面影响,发现其无意中增加劫持风险,并通过实验验证了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05877 2026-02-06 cs.AI cs.HC 79%

Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy

安全关键型LLM助手中的Agent2Agent威胁:以人为中心的分类

Lukas Stappen, Ahmet Erkan Turan, Johann Hagerer, Georg Groh

机构 * BMW Group Research(宝马集团研究) Technical University Munich(慕尼黑技术大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AgentHeLLM框架,通过分离资产识别与攻击路径分析,为安全关键型LLM助手提供以人为中心的威胁建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08859 2026-02-06 cs.CL cs.AI cs.CR 62%

Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models

模式增强的多轮劫持:在大语言模型中利用结构漏洞

Ragib Amin Nihal, Rui Wen, Kazuhiro Nakadai, Jun Sakuma

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PE-CoA框架,通过五个对话模式构建多轮劫持攻击,揭示了大语言模型在不同危害类别下的漏洞及防御局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏