A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Under Review
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.LG
Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性
机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) ; Khalifa University(卡利法大学) ; Michigan State University(密歇根州立大学) ; Australian National University(澳大利亚国立大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);trustworthy(comments)
AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。
Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025
面向地下论坛中自动化网络威胁情报的获取
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 本文提出首个基于多智能体大语言模型的主动CTI获取系统DarkBot,其在受控与真实世界实验中均优于基线,可从地下论坛高效获取CTI且安全合规。
Comments 23 pages, 19 figures
执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。
Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security
演化技能结构攻击记忆增强大语言模型越狱
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 提出MemAttack框架,通过技能结构化的攻击记忆建模、生命周期驱动的记忆演化和探索-利用平衡的记忆选择,实现高效的黑盒越狱攻击,在AdvBench上达到98.00%攻击成功率。
Comments Under review
CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。
TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。
大型语言模型中毒性检测的分布式质量-多样性搜索
专题命中 越狱攻击 :safety(abstract);AI safety(abstract)
AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。
Comments 40 pages, 10 figures, preprint
现实中的思维链推理并不总是忠实的
机构 * Poseidon Research(Poseidon研究)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现,在自然语言提示下,模型有时会生成表面连贯但自相矛盾的思维链,揭示出隐含的事后合理化现象,且前沿模型也未能完全避免。
Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)
OpenClaw的安全工程:分析攻击面扩展与信任边界违反
专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract)
AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。
Acoda:对抗性代码混淆防御基于LLM的分析
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。
PLAGUE:面向多轮利用的终身自适应生成的即插即用框架
机构 * A10 Networks, Inc.(A10网络公司) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PLAGUE框架,通过终身学习启发的三阶段设计(Primer、Planner、Finisher)实现高效多轮越狱攻击,在o3和Opus 4.1等强安全模型上ASR提升超30%。
Comments Accepted in ICLR 2026
良性输入,有害输出:通过分布式语义重组的跨模态越狱
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。
Comments 11 pages, 5 figures
对抗性重构:一种用于语言模型针对性生成的框架
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 本文提出THREAT框架,通过协调多个语言模型进行迭代搜索,寻找文本劫持提示,并通过非凸优化问题解决提示发现问题,提高了攻击成功率并降低了计算成本。
TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优
机构 * Fellow, IEEE(IEEE会士)
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。
稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙
机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) ; Waseda University(早稻田大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。
MASCing:通过激活引导掩码实现可配置的专家混合行为
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 MASCing通过LSTM模型捕捉跨层路由依赖,利用引导矩阵优化专家电路,实现无需重新训练的MoE行为灵活重构,提升安全场景下的模型性能。
Spore:通过推理时间混合探测实现高效的隐私提取攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 本文提出Spore攻击,通过推理时间混合探测实现对LLM内存的隐私提取,无需训练,适用于黑盒和灰盒环境,具有高效查询和高信息泄露率。
NeuroStrike:对对齐大语言模型的神经层面攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。
激活手术:无需修改提示的白盒LLM劫持
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 本文提出通过直接操控模型内部激活来改变生成轨迹,揭示拒绝产生的位置与机制,并抑制安全机制,探讨开放权重模型的安全影响。
Comments To appear in Proceedings of ESORICS 2026 (Springer LNCS)
SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。
Comments ICLR 2026
意外漏洞:影响微调的因子
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; ETH Zürich(苏黎世联邦理工学院) ; FAR AI(FAR人工智能公司) ; McGill University(麦吉尔大学) ; MILA(蒙特利尔人工智能研究院) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响
Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)
通过细粒度细节靶向推动大视觉-语言模型攻击的前沿
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过细粒度细节靶向改进M-Attack,显著提升黑盒攻击效果,成功率达100%
Comments Code at: https://github.com/vila-lab/M-Attack-V2
消解事实默认:对人类在真实世界中对基础模型幻觉和虚假信息易感性的因果分析
机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文通过双轴框架分析人类对基础模型幻觉和虚假信息的易感性,发现假新闻熟悉度是关键中介,提出应通过提升认知来源监控来确保信息可信。
Comments Accepted at ACM TheWebConf '26 Companion
基于能力的LLM红队测试规模趋势
机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; Tübingen AI Center(图宾根人工智能中心) ; Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) ; EPFL(苏黎世联邦理工学院)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。
Comments Published as a conference paper at ICLR 2026
视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题
机构 * Monash University Indonesia(墨尔本大学印尼分校) ; MBZUAI ; Boston University(波士顿大学) ; University of Edinburgh(爱丁堡大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。
Comments Submitted to ARR January
在物理信息系统中保障AI代理:环境交互、深度伪造威胁及防御的综述
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 本文综述了物理信息系统中AI代理的安全威胁,重点分析了环境交互、深度伪造攻击及MCP漏洞,并提出基于SENTINEL框架的防御策略与挑战。