arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2501.04633 2026-06-09 cs.HC cs.CY cs.RO 57%

"Can you be my mum?": Manipulating Social Robots in the Large Language Models Era

你能做我的妈妈吗?:在大型语言模型时代操纵社交机器人

Giulio Antonio Abbo, Gloria Desideri, Tony Belpaeme, Micol Spitale

机构 * IDLab-AIRO , Ghent University – imec(IDLab-AIRO 和根特大学-imec) DEIB , Politecnico di Milano(DEIB 和米兰理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 研究探讨了在大型语言模型时代,用户如何利用机器人违反伦理原则,通过三种场景测试发现五种操纵技术,旨在为设计更安全的伦理人机交互提供参考。

Comments 10 pages, 2 figures

Journal ref HRI '25: Proceedings of the 2025 ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05779 2026-06-05 cs.CR cs.AI stat.ML 57%

TinyML-Driven Cybersecurity for Autonomous Spacecraft: Latency-Accuracy Analysis for SPARTA RF and Cyber Threat Detection

TinyML驱动的自主航天器网络安全:SPARTA射频与网络威胁检测的延迟-精度分析

Van Le, Trevor Tran, Tan Le

机构 * Virginia Tech(弗吉尼亚理工学院) Hampton University(哈姆普顿大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 针对自主航天器,基于SPARTA攻击模型分析TinyML兼容经典模型(随机森林、逻辑回归、SVM、MLP)在检测多种网络射频威胁时的延迟-精度权衡,发现逻辑回归在微秒级推理下仅比随机森林精度低1%,适合作为机载自主基线。

Comments Twenty Fifth International Conference on Security & Management (SAM'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04027 2026-06-04 cs.CR cs.AI 57%

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

MaskForge:用于越狱扩散大语言模型的结构感知自适应攻击

Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu, Minhui Xue, Yue Zhao, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) University of Southern California(南加州大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(阿德莱德大学负责任人工智能研究中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出MaskForge,一种全黑盒自适应攻击方法,通过优化结构模式库实现扩散大语言模型的红队测试,平均攻击成功率达79.3%。

Comments 28 pages, 7 figures, 11 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03695 2026-06-03 cs.CL 57%

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

不要忘记你的嵌入:通过精确编辑嵌入实现鲁棒的知识擦除

Clara Haya Suslik, Or Shafran, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(巴尔-艾赫伦计算机科学与人工智能学院,特拉维夫大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 提出 EMBER 模块,利用稀疏矩阵分解精确擦除词嵌入中的概念相关特征,增强现有知识擦除方法的鲁棒性和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03136 2026-06-03 cs.CR cs.CL 57%

PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

PsychoPass: 多轮对抗性LLM对话的几何轮廓分析

Muberra Ozmen, Subhabrata Majumdar

机构 * Coveo Montreal, QC, Canada(加拿大蒙特利尔 Coveo) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出PsychoPass框架,通过提取对话轨迹在嵌入空间中的几何特征,在有害内容生成前预测多轮越狱攻击,并发现早期几何信号具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01494 2026-06-02 cs.CR cs.AI cs.SE 57%

ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree

ClawHub安全信号:当VirusTotal、静态分析和SkillSpector意见不一致时

Vincent Koc, Patrick Erichsen, Jacob Tomlinson, Agustin Rivera, Michael Appel, Nir Paz

机构 * OpenClaw Foundation USA(OpenClaw基金会美国) NVIDIA United Kingdom(NVIDIA英国分公司) NVIDIA USA(NVIDIA美国)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究ClawHub中67,453个公开技能版本,通过VirusTotal、静态启发式分析和NVIDIA SkillSpector三种扫描器的分歧,揭示智能体技能安全需要分层治理而非单一扫描器决策。

Comments 10 pages, 1 figure, 7 tables, 1 supplimentary dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01441 2026-06-02 cs.AI 57%

Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

深入歧义:基于A*的多智能体常识混淆攻击LLM提示

Boxuan Wang, Zhuoyun Li, Xiaowei Huang, Yi Dong

机构 * University of Liverpool(利物浦大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出一种基于A*的事实错误诱导框架,通过层次化重写策略和动态语义分散系数生成语义对齐但混淆的提示,以高效攻击LLM的常识推理。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR 57%

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31593 2026-06-01 cs.CR cs.AI 57%

Stateful Online Monitoring Catches Distributed Agent Attacks

有状态在线监控捕获分布式智能体攻击

Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对分布式智能体攻击中跨账户聚合的恶意行为难以被单上下文监控检测的问题,提出一种基于实时聚类的有状态在线监控方法,能够更早、更有效地捕获分布式攻击,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30667 2026-06-01 cs.CR cs.AI 57%

Automatically Attacking Software Reverse Engineering AI Agents

自动攻击软件逆向工程AI代理

Brian Crawford, Justin Phillips, Patrick McClure

机构 * Naval Postgraduate School(海军学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出基于遗传算法的对抗性提示生成技术(AutoDAN变体),通过注入无关字符串变量欺骗LLM驱动的反汇编与反编译系统,导致其错误分析二进制可执行文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29910 2026-05-29 cs.SE cs.AI 57%

Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents

Agora: 面向生产级共识协议中自主漏洞检测的LLM智能体

Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Information and Telecommunication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与电信工程学院) Peking University(北京大学) G Labs(0G实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出Agora,一个领域感知的多智能体框架,通过假设驱动测试和LLM协作,在Raft、EPaxos、HotStuff、BullShark四个共识实现中发现15个未知协议级逻辑漏洞,而现有LLM方法未能检测到任何此类漏洞。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28632 2026-05-28 cs.CR cs.AI 57%

Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking

盲PRNG劫持:一种针对LLM水印的不可检测的完整性保持攻击

Ziyang You, Huilong He, Xiaoke Yang, Xuxing Lu

机构 * Fujian Provincial Key Laboratory of Automotive Electronics and Electric Drive(福建省汽车电子与电力驱动重点实验室) School of Electronic, Electrical and Physics(电子、电气与物理学院) Fujian University of Technology(福建理工大学) School of Humanities(人文学院) Institute of Applied Physics and Materials Engineering(应用物理与材料工程学院) University of Macau(澳门大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 提出SeedHijack攻击,通过替换伪随机数生成器(PRNG)在供应链层面对LLM水印进行盲攻击,同时保持完整性并规避检测。

Comments Preprint prepared for submission to IEEE TIFS. 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28201 2026-05-28 cs.AI 57%

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

种植、持久化、触发:针对大语言模型智能体的潜伏攻击

Yongxiang Li, Moxin Li, Zhixin Ma, Fengbin Zhu, Dongrui Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出潜伏攻击(Sleeper Attack),即攻击者将对抗性内容注入智能体状态并持久化,在后续交互中被良性用户查询触发,导致有害行为;构建包含1896个实例的基准测试,实验表明当前最强LLM智能体仍易受此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27927 2026-05-28 cs.CV cs.LG 57%

Structure-Guided Visual Perturbation Neutralization for LVLMs

结构引导的视觉扰动中和用于大型视觉语言模型

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) JIUTIAN Research(JIUTIAN研究所) Nanyang Technological University(南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 提出结构诱导引导中和(SIGN)框架,通过先验结构提取和动态引导中和实现轻量级、即插即用的对抗性防御,在仅0.5%像素修改和0.16秒每图下达到87%以上防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27110 2026-05-27 cs.CR cs.CL 57%

BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning

BAIT: 基于边界引导的自我条件推理披露升级

Xuan Luo, Yue Wang, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出BAIT三步越狱框架,通过识别保护边界、细化边界和请求详细示例,利用模型自身推理和一致性倾向实现恶意目标披露,实验表明在多个基准上攻击成功率显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26526 2026-05-27 cs.LG cs.CR 57%

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

开源权重大语言模型微调防御易受简单攻击

Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文发现针对开源权重大语言模型的防御措施易受abliteration和prefilling等低成本攻击,并提出abliteration-resistant tuning (ART) 方法将攻击成功率降低10%-20%。

Comments main body: 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09621 2026-05-20 cs.CR cs.CY 57%

Technologies and Security Challenges in Metaverse

元宇宙中的技术与安全挑战

Krishno Dey, Diogo Barradas, Saqib Hakak

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 本文研究了元宇宙中的技术基础和安全挑战,通过系统性文献综述分析了元宇宙平台中的关键漏洞及应对措施,总结了当前进展、研究空白和未来发展方向,以确保元宇宙的安全性和伦理规范性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18150 2026-05-19 cs.AI 57%

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

噪声中的低语:通过多智能体框架引导的代理觉醒

Mengyu Sun, Ziyuan Yang, Zunlong Zhou, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在黑盒约束下如何通过多智能体框架从预训练模型中恢复被擦除的概念,提出了一种无需训练的代理方法,通过引导噪声状态来实现可控的觉醒,展示了当前概念擦除方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18083 2026-05-19 cs.CL 57%

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE

多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展

Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15172 2026-05-15 cs.CR cs.CL 57%

MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

MetaBackdoor:利用位置编码作为大语言模型中的后门攻击面

Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem

机构 * Institute of Science Tokyo(东京科学研究院) Microsoft Azure(微软Azure) Microsoft Security Response Center(微软安全响应中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出MetaBackdoor,通过利用位置信息作为触发器,而非修改文本内容,实现对大语言模型的后门攻击,展示了长度相关的触发器可激活隐蔽后门,并展示了自我激活场景和与内容后门的组合攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 57%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 57%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 57%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13115 2026-05-14 cs.CR cs.LG 57%

DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense

DiffusionHijack: 供应链PRNG后门攻击针对扩散模型和量子随机数防御

Ziyang You, Liling Zheng, Xiaoke Yang, Xuxing Lu

机构 * School of Electronics, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子工程与物理学院) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究提出DiffusionHijack攻击通过供应链注入恶意PRNG控制扩散模型生成图像,采用量子随机数生成器有效防御该攻击,降低输出相似度至随机基线水平。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13044 2026-05-14 cs.CR cs.AI 57%

No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills

无需攻击:用于代理技能规范违规的语义模糊测试

Ying Li, Hongbo Wen, Yanju Chen, Hanzhi Liu, Yuan Tian, Yu Feng

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Sefz框架,通过语义模糊测试发现代理技能中的规范违规问题,揭示了安全规则漏洞对用户信任的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11770 2026-05-13 cs.CR cs.AI cs.SY eess.SY 57%

Behavioral Integrity Verification for AI Agent Skills

AI代理技能的行为完整性验证

Yuhao Wu, Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11029 2026-05-13 cs.CR cs.AI 57%

FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

FragBench:隐藏在看似无害片段中的跨会话攻击

Astha Mehta, Niruthiha Selvanayagam, Cedric Lam, Hengxu Li, Phuc-Nguyen Nguyen, Raymond Lee, Olivia McGoffin, My, Luong, Arthur Collé, Jamie Johnson, David Williams-King, Linh Le

机构 * New York University(纽约大学) Tufts University(塔夫茨大学) Distributed Systems(分布式系统) ERA(欧洲研究联盟) Lida Safety(Lida安全) Mila

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 FragBench通过24个真实网络攻击案例构建,评估LLM跨会话攻击检测,采用对抗重写和图基检测方法,实现事件级F1分数达0.88-0.96。

Comments preprint of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10582 2026-05-12 cs.CR cs.AI 57%

Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing

通过干扰-校正平滑实现保证的对抗防御

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :harmlessness(abstract);分类 cs.AI

AI总结 本文提出了一种基于平滑的新型防御方法,通过干扰-校正机制提升大语言模型对劫持攻击的防御能力,理论分析提供了防御成功的紧界和干扰强度要求,实验表明其在安全性和有用性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏