Large Reasoning Models Are Autonomous Jailbreak Agents
大推理模型是自主的越狱代理
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大推理模型是自主的越狱代理
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用
SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体
专题命中 越狱攻击 :safety(title,abstract)
AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。
通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测
机构 * KAUST(卡塔尔人工智能研究所在线中心)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG
AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。
大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。
MemPot:通过优化的陷阱来防御内存提取攻击
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; Southern University of Science and technology(南方科技大学)
专题命中 越狱攻击 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。
基于能力的LLM红队测试规模趋势
机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; Tübingen AI Center(图宾根人工智能中心) ; Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) ; EPFL(苏黎世联邦理工学院)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。
Comments Published as a conference paper at ICLR 2026
视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题
机构 * Monash University Indonesia(墨尔本大学印尼分校) ; MBZUAI ; Boston University(波士顿大学) ; University of Edinburgh(爱丁堡大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。
Comments Submitted to ARR January
CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具
机构 * University of Calabria(卡利博里大学) ; IMT School for Advanced Studies(IMT高级研究学院)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI
AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。
Journal ref Future Generation Computer Systems, 176, 2026, 108186