arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2512.23849 2026-07-27 cs.CR cs.AI cs.DC cs.LG 版本更新 62%

Security Without Detection: Economic Denial as a Primitive for Edge and IoT Defense

无需检测的安全:经济否认作为边缘和物联网防御的基本原理

Samaresh Kumar Singh, Joyjit Roy, Sriharsha Anand Pushkala

机构 * st Samaresh Kumar Singh(第一作者机构) nd Joyjit Roy(第二作者机构)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EDS是一种不依赖检测的物联网和边缘安全方法,通过经济成本放大机制有效遏制攻击,实现超线性成本增加和高缓解率。

Comments 8 pages, 2 figures, submitted to 3rd International Conference on Intelligent Digitization of Systems and Services (IDSS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31796 2026-07-24 cs.CL cs.AI 版本更新 62%

CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

CHERRY: 具有循环表示收益的压缩层次专家

Dohyeon Kwon, Youngjin Park

机构 * TeamSparta Inc.(TeamSparta公司)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。

Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18567 2026-07-22 cs.AI cs.CR cs.LG 新提交 62%

Attacking Graph Foundation Models Through Their Shared Representation

通过共享表示攻击图基础模型

Pankaj Kumar, Subhankar Mishra

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究通过攻击图基础模型的共享表示来探索其脆弱性,采用表示空间扰动和输入空间攻击等方法,针对六个公共模型进行实验,发现不同模型的脆弱性表现,如OpenGraph的频谱分词器有特定脆弱性,还分析了脆弱性与解码器读取表示的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 62%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07368 2026-07-09 cs.LG cs.AI cs.MA 新提交 62%

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

多智能体人工智能控制:分布式攻击阻碍实例级监测

Oliver Makins, Orazio Angelini, Zohreh Shams, Mary Phuong

机构 * MATS Research(MATS研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体人工智能控制中的分布式攻击,开发FakeLab代码库,评估单智能体监测应对分布式攻击的效果,发现碎片化效应,指出其与代码比例无关,受模型能力影响,还揭示显式规划器及不同强度监测的作用。

Comments Submitted to NeurIPS; 81 pages; 32 figures and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 62%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23884 2026-07-02 cs.CL cs.AI 新提交 62%

One Year Later...The Harms Persist, But So Do We!

一年后...伤害持续,但我们仍在!

Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar, Anson Antony

机构 * Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。

Comments 20 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 62%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16346 2026-06-09 cs.CL cs.LG 版本更新 62%

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

有益于故障:测量多轮、多语言LLM代理中的非法协助

Nivya Talokar, Ayush K Tarun, Murari Mandal, Maksym Andriushchenko, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院) independent(独立研究员) tubingen(图宾根大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STING框架,用于评估多轮多语言LLM代理在执行非法任务时的协助能力,发现低资源语言中攻击成功率不一致,提供实际部署中的压力测试方法。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG 62%

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24511 2026-06-02 cs.LG cs.AI cs.CR 62%

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Claudini: 自动研究发现针对LLM的最先进对抗攻击算法

Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

机构 * MATS ELLIS Institute(MATS ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Imperial College London(伦敦帝国理工学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自动研究循环,利用前沿AI代理(如Claude Code和Codex)自动发现针对大语言模型的新型对抗攻击算法,在白盒越狱和提示注入评估中达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22666 2026-06-02 cs.CR cs.CL cs.LG stat.ML 62%

VERA: Variational Inference Framework for Jailbreaking Large Language Models

VERA:用于越狱大型语言模型的变分推理框架

Anamika Lochab, Lu Yan, Patrick Pynadath, Xiangyu Zhang, Ruqi Zhang

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 提出VERA框架,将黑盒越狱提示生成视为变分推理问题,训练小型攻击者LLM近似目标LLM的对抗提示后验,无需重新优化即可生成多样且流畅的越狱提示。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24319 2026-06-01 cs.CL cs.AI 62%

Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models

价值表达的双重机制:大型语言模型中的内在价值与提示价值

Jongwook Han, Jongwon Lim, Injin Kong, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过价值向量和价值神经元分析,揭示大型语言模型中内在价值表达与提示价值表达在机制上部分共享核心组件,但各自拥有独特功能,内在机制促进多样性,提示机制增强指令遵从。

Comments Accepted at ICML 2026. Project page: https://holi-lab.github.io/ValueMechanism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28122 2026-05-28 cs.CR cs.AI cs.CL 62%

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

SNARE: 自适应场景合成以诱发编码代理中的过度行为

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) UNSW Sydney(悉尼大学) Wake Forest University(卫斯理大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 提出SNARE流水线,通过组合良性场景片段并使用无评判器预言机评分与汤普森采样,自适应地诱发编码代理的过度行为,并在4×5代理-模型矩阵上评估,发现19.51%的良性运行触发过度行为,且代理框架比模型影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14605 2026-05-26 cs.CR cs.AI cs.LG 62%

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

一步之遥:为什么针对恶意微调的防御在自适应对手面前失败

Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

机构 * Ben-Gurion University of the Negev(贝纳-约瑟夫大学) Amrita Vishwa Vidyapeetham(阿米塔维莎瓦迪耶佩塔)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析15种近期防御机制,发现它们共享一个弱点:仅掩盖或误导有害行为路径而未消除行为本身,并开发了一种统一的自适应攻击,成功突破了所有防御机制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 62%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22842 2026-05-25 cs.CR cs.AI cs.LG 62%

The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems

归因偏差:当记忆中毒在自主AI系统中看起来像模型失败时

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校计算机学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文识别了多智能体AI系统中的“归因偏差”问题,即记忆层攻击导致的行为与模型失败无法区分,并形式化了“语义规范漂移”(SND)作为第三种不当行为路径,提出了反事实组合测试和记忆持久信息流控制等防御方法。

Comments This paper is presently under review at a top-tier security venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20641 2026-05-21 cs.CR cs.AI cs.LG 62%

Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

可信的权重,危险的优化?针对大语言模型的优化触发后门攻击

Yifei Wang, Tianlin Li, Xiaohan Zhang, Yida Yang, Xiaoyu Zhang, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种利用编译优化过程植入隐蔽后门的攻击方法,通过两种互补策略在无需修改编译器或硬件的情况下,实现对大语言模型的后门攻击,并展示了其在多个开源大语言模型上的高成功率。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19966 2026-05-20 cs.LG cs.AI 62%

Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

通过顺序熵变化检测基于优化的对抗性提示

Mohammed Alshaalan, Miguel R. D. Rodrigues

机构 * Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,伦敦,英国)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于在线变化点检测的对抗性后缀检测方法CPD,通过标准化用户令牌熵并应用单侧CUSUM统计量,提高了对优化基于对抗性提示的检测性能,同时在多个大型语言模型上实现了更高的F1分数和AUC性能。

Comments Accepted at ICML 2026; 20 pages, including 9 pages main text, references, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18930 2026-05-20 cs.CR cs.AI cs.LG 62%

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

OEP: 通过局部正确但不可转移的经验污染自演化LLM代理

Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了通过局部正确但不可转移的经验污染自演化LLM代理的安全风险,提出OEP攻击方法,利用低权限黑盒攻击在无需直接控制系统提示或记忆数据库的情况下诱导有害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV 62%

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08898 2026-05-12 cs.CL cs.AI 62%

LLM-Agnostic Semantic Representation Attack

不依赖特定大语言模型的语义表示攻击

Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Tairan Huang, Shaohui Mei, Lap-Pui Chau

机构 * JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) Hong Kong Jockey Club Charities Trust(香港赛马会慈善信托基金) Global STEM Professorship Scheme of the Hong Kong Special Administrative Region (SAR)(香港特别行政区(SAR)的全球STEM教授计划) National Natural Science Foundation of China(中国国家自然科学基金委员会) Northwestern Polytechnical University(西北工业大学) The Hong Kong Polytechnic University(香港理工大学) School of Electronics and Information(电子与信息学院) Department of Electrical and Electronic Engineering(电气与电子工程系) Hong Kong Institute of AI for Science(香港人工智能科学研究院) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义表示攻击(SRA),通过重新定义对抗目标从精确文本到恶意语义,解决传统方法的收敛性、提示自然性和跨模型泛化问题,实现99.71%的攻击成功率。

Comments arXiv admin note: substantial text overlap with arXiv:2509.19360

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24082 2026-04-28 cs.CR cs.AI cs.CL 62%

Jailbreaking Frontier Foundation Models Through Intention Deception

通过意图欺骗突破前沿基础模型

Xinhe Wang, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。

Comments Accepted at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20833 2026-04-28 cs.CR cs.AI cs.CL 62%

AVISE: Framework for Evaluating the Security of AI Systems

AVISE:人工智能系统安全性的评估框架

Mikko Lempinen, Joni Kemppainen, Niklas Raesalmi

机构 * University of Oulu(奥卢大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AVISE框架,用于识别和评估人工智能系统安全漏洞,通过改进的Red Queen攻击和自动化安全测试发现语言模型的逃逸漏洞,展示了框架的高效性和广泛适用性。

Comments Fixed LaTex label command typos in Tables 8 and 9; fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08608 2026-04-22 cs.CR cs.AI cs.LG 62%

Semantic Intent Fragmentation: A Single-Shot Compositional Attack on Multi-Agent AI Pipelines

语义意图碎片化:一种针对多智能体AI流水线的单次组合攻击

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Yoonpyo Lee, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯理工大学计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校计算机学院) Hanyang University(翰阳大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出语义意图碎片化攻击,通过单个合法请求导致任务分解为看似无害但联合违反安全策略的子任务,利用OWASP LLM06:2025框架实现无注入内容、无系统修改的攻击,验证了组合安全漏洞的可修复性。

Comments This paper got accepted for AAAI 2026 Summer Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00161 2026-04-22 cs.LG cs.CL 62%

Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs

监视权重:无监督的细调大语言模型监控与控制

Ziqian Zhong, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过监控权重而非激活值来理解、监控和控制细调的大语言模型,能高精度检测细调引入的新行为,并在防回火攻击和模型去学习中表现出色。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04561 2026-04-07 cs.CR cs.AI cs.CL 62%

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

映射利用表面:一种10000次试验的分类,揭示使LLM代理利用漏洞的因素

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(OPIT——开放理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过10000次试验分析系统提示特征对LLM代理利用漏洞的影响,发现目标重构是唯一可靠触发因素,其他维度在特定条件下未产生显著利用。

Comments 18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07985 2026-04-07 cs.LG cs.AI cs.CR 62%

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

更少的权重,更多的问题:对LLM剪枝的一种实用攻击

Kazuki Egashira, Robin Staab, Thibaud Gloaguen, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文首次揭示了现代LLM剪枝方法可能被恶意利用的问题,通过构造看似无害的模型,在剪枝后表现出恶意行为,展示了剪枝过程中的安全风险。

Comments ICLR 2026. Code: https://github.com/eth-sri/llm-pruning-attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 62%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏