arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-12 至 2026-01-12 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2601.05742 2026-01-12 cs.CR cs.AI 79%

The Echo Chamber Multi-Turn LLM Jailbreak

回声室多轮LLM劫持

Ahmad Alobaid, Martí Jordà Roca, Carlos Castillo, Joan Vendrell

机构 * NeuralTrust ICREA and UPF(ICREA和UPF)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05466 2026-01-12 cs.CR cs.AI 70%

Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning

通过强化学习的迭代工具伪装攻击对大型语言模型进行劫持

Zhaoqi Wang, Zijian Zhang, Daqing He, Pengtao Kou, Xin Li, Jiamou Liu, Jincheng An, Yong Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息科学与技术学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science, University of Auckland(计算机科学学院,奥克兰大学) QAX Security Center, Qi-AnXin Technology Group Inc.(QAX安全中心,启安新科技集团) Qi-AnXin Technology Group Inc.(启安新科技集团) Zhongguancun Laboratory(中关村实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出iMIST方法,通过伪装工具调用和强化学习优化,提高对大型语言模型的攻击效果,揭示现有安全机制的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05445 2026-01-12 cs.CR cs.LG 57%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 57%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏