arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2602.05444 2026-02-09 cs.CL 85%

Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs

因果前门调整用于对抗大语言模型的鲁棒性劫持攻击

Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Hong Kong University of Science and Technology, China, Hong Kong, China(香港科学与技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出CFA²攻击方法,通过因果前门准则和稀疏自编码器实现对大语言模型的鲁棒性劫持,提升攻击成功率并提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06440 2026-02-09 cs.CL cs.AI cs.CR 79%

TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking

TrailBlazer: 基于历史的强化学习用于黑盒大语言模型劫持

Sung-Hoon Yoon, Ruizhi Qian, Minda Zhao, Weiyue Li, Mengyu Wang

机构 * Daegu Gyeongbuk Institute of Science and Technology(大邱庆 bun 科学技术研究院) Harvard University(哈佛大学) University of Southern California(南加州大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI

AI总结 TrailBlazer通过历史感知强化学习提升黑盒大语言模型劫持效率,实现更高效的攻击策略和更高的查询效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06630 2026-02-09 cs.CR 50%

TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking

TrapSuffix: 对抗对抗性后缀的主动防御在劫持中

Mengyao Du, Han Fang, Haokai Ma, Gang Yang, Quanjun Yin, Shouling Ji, Ee-Chien Chang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 TrapSuffix通过主动防御机制,使攻击者陷入无赢困境,有效降低劫持攻击成功率并提高可追溯性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏