arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2508.04039 2026-02-10 cs.CL cs.AI cs.CR 86%

Large Reasoning Models Are Autonomous Jailbreak Agents

大推理模型是自主的越狱代理

Thilo Hagendorff, Erik Derner, Nuria Oliver

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 78%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 越狱攻击 :safety(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08062 2026-02-10 cs.LG cs.CR 77%

Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation

通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测

Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi, Marco Canini

机构 * KAUST(卡塔尔人工智能研究所在线中心)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG

AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08741 2026-02-10 cs.CR 75%

Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing

大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持

Jona te Lintelo, Lichao Wu, Stjepan Picek

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07517 2026-02-10 cs.CR cs.AI cs.CL cs.DB 73%

MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots

MemPot:通过优化的陷阱来防御内存提取攻击

Yuhao Wang, Shengfang Zhai, Guanghao Jin, Yinpeng Dong, Linyi Yang, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Southern University of Science and technology(南方科技大学)

专题命中 越狱攻击 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG 67%

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06973 2026-02-10 cs.CL cs.AI cs.LG 67%

Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models

视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题

Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini, Farid Adilazuarda, Alham Fikri Aji, Derry Tanti Wijaya

机构 * Monash University Indonesia(墨尔本大学印尼分校) MBZUAI Boston University(波士顿大学) University of Edinburgh(爱丁堡大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。

Comments Submitted to ARR January

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏