arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2502.12497 2026-07-10 cs.CR 版本更新 50%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21664 2026-07-08 cs.CV 版本更新 50%

HumanOmni-Speaker: Identifying Who said What and When

HumanOmni-Speaker: 识别说话者说了什么以及何时

Detao Bai, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里云实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 50%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 50%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 越狱攻击 :safety(abstract)

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01356 2026-07-03 cs.CR cs.SY eess.SY 新提交 50%

Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates

Chameleon: 通过ML代理从内存破坏攻击中恢复信息物理系统

Mohsen Salehi, Karthik Pattabiraman

专题命中 越狱攻击 :safety(abstract)

AI总结 提出Chameleon框架,利用基于机器学习的代理在检测到攻击时替换受损组件,实现信息物理系统从内存破坏攻击中的自动恢复,在多种机器人车辆上验证了高保真度和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00361 2026-07-02 cs.CR 新提交 50%

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

专题命中 越狱攻击 :safety(abstract)

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26377 2026-06-26 cs.CR 新提交 50%

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

验证意图与危害:针对LLM生成威胁的统一防御

Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21842 2026-06-23 cs.CR 新提交 50%

Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG

代理辅助的非前缀KV缓存侧信道攻击

He Sun, Shinan Liu, Siyuan Ma, Junhao Li, Mingjun Xiao, Wenhao Jiang

专题命中 越狱攻击 :alignment(abstract)

AI总结 针对RAG系统中非前缀KV缓存融合的侧信道漏洞,提出SpliceLeak攻击,利用“阶梯波”时序特征提取私有提示长度和语义内容,并设计SpliceDefense防御机制。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01410 2026-06-16 cs.HC 版本更新 50%

What LLMs Must Forget to Teach Effectively: A DIY Approach to Premodern Japanese Language Pedagogy

LLM必须忘记什么才能有效教学:前现代日语教学法的DIY方法

Ariel Stilerman, Andrew Nelson, Alan Cheng, Caleb Langley, Sera Wang, Camilla Piana, Pelin Çılgın, Qianhe Qin, Teisha Nishimitsu, Liaoliao Zhang, Huiting Liu, Josh Eyre, Gavin Sherry

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出一种基于大型语言模型(LLM)的DIY教学框架,通过提示工程创建定制工具,避免LLM过度解释或产生幻觉,从而促进前现代日语文学和语言课程中的主动理解与教学对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15125 2026-06-08 cs.CR 版本更新 50%

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

从存储到操控:针对LLM代理的内存控制流攻击

Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue, Yiliao Song

专题命中 越狱攻击 :safety(abstract)

AI总结 本文研究了内存控制流攻击对LLM代理的影响,提出MEMFLOW框架以系统识别和量化此类攻击,发现超过90%的测试在严格安全约束下仍易受攻击,揭示了严重的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 50%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26384 2026-05-27 cs.DC cs.PF cs.SY eess.SY 50%

GridPilot: Real-Time Grid-Responsive Control for AI Supercomputers

GridPilot:面向AI超级计算机的实时电网响应控制

Denisa-Andreea Constantinescu, David Atienza

专题命中 越狱攻击 :safety(abstract)

AI总结 提出GridPilot三层预测控制器,在GPU测试台上实现97.2毫秒的端到端电网响应,比北欧快速频率储备要求快6.9倍,并通过PUE感知控制消除冷却开销,证明兆瓦级AI/HPC负载可设计为可控的电网灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17772 2026-05-19 cs.CV 50%

Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework

通过联合多目标和多模型优化框架实现通用物理对抗攻击

Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

机构 * Research Center for Space Optical Engineering, Harbin Institute of Technology(哈尔滨工业大学空间光学工程研究中心) Zhengzhou Research Institute, Harbin Institute of Technology(郑州研究院,哈尔滨工业大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出了一种联合多目标和多模型优化框架(JMOF),通过定量相似性分析选择最优的替代模型集合,以解决物理对抗攻击中单个替代模型过拟合和优化目标的问题,同时通过双层机制平衡攻击效率与深度泛化,并通过正交梯度对齐策略解决跨模型梯度冲突,从而提升攻击效果和跨任务泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 50%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-05-14 cs.CR 50%

SoK: Exposing the Generation and Detection Gaps in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12565 2026-05-14 cs.CR 50%

Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery

基于身份的对抗提示生成(PCAP):多身份红队测试以提升对抗提示发现

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

专题命中 越狱攻击 :jailbreak(abstract_cn)

AI总结 PCAP通过结合攻击者身份和策略卡进行对抗搜索,提高攻击成功率和提示多样性,增强对抗策略覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11514 2026-05-13 cs.CR 50%

FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems

FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞

Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

专题命中 越狱攻击 :safety(abstract)

AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09889 2026-05-12 cs.MA 50%

Skill Description Deception Attack against Task Routing in Internet of Agents

针对物联网代理中任务路由的技能描述欺骗攻击

Jiayi He, Xiaofeng Luo, Jiawen Kang, Ruichen Zhang, Jianhang Tang, Dong In Kim

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。

Comments Submitted to IEEE Globecom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09397 2026-05-12 cs.CR 50%

BadDLM: Backdooring Diffusion Language Models with Diverse Targets

BadDLM:针对扩散语言模型的多样化目标后门攻击研究

Shengfang Zhai, Xiaoyang Ji, Yuling Shi, Haoran Gao, Fanyu Meng, Yan Zeng, Yuejian Fang, Yinpeng Dong, Jiaheng Zhang

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出BadDLM框架,研究扩散语言模型的后门攻击,通过触发感知训练目标和理论证明,展示其在概念注入、语义属性引导等目标上的有效性,揭示扩散生成中的新安全风险。

Comments 21 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 越狱攻击 :safety(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 50%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 越狱攻击 :alignment(abstract)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 50%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 50%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 越狱攻击 :safety(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24051 2026-04-28 cs.CR 50%

System-aware contextual digital twin for ICS anomaly diagnosis

面向系统的上下文数字孪生用于ICS异常诊断

Eungyu Woo, Yooshin Kim, Wonje Heo, Donghoon Shin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出一种面向系统的无监督框架,结合轻量级在线检测与上下文解释,实现ICS异常诊断的实时检测和可解释诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02450 2026-04-28 cs.CV 50%

GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection

GCP: 带空间-时间感知恶意代理检测的防护协作感知

Yihang Tao, Senkang Hu, Yue Hu, Haonan An, Hangcheng Cao, Yuguang Fang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。

Comments Accepted by IEEE TDSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07527 2026-04-23 cs.CR 50%

Security Modelling for Cyber-Physical Systems: A Systematic Literature Review

面向网络物理系统的安全建模:系统文献综述

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

专题命中 越狱攻击 :safety(abstract)

AI总结 本文系统回顾了网络物理系统安全建模的研究,探讨威胁与攻击建模的区别及其对系统安全的影响,总结现有研究的局限性。

Comments Accepted by ACM Transactions on Cyber-Physical Systems (TCPS)

Journal ref ACM Trans. Cyber Phys. Syst. 10(2), Article 20, 1-29 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV 50%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13308 2026-04-16 cs.CR cs.SY eess.SY 50%

Threat Modeling and Attack Surface Analysis of IoT-Enabled Controlled Environment Agriculture Systems

物联网赋能可控环境农业系统的威胁建模与攻击面分析

Andrii Vakhnovskyi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次提出物联网可控环境农业系统的全面威胁模型,识别123种威胁并提出防御框架,揭示AI驱动农业中的新型攻击类别及物理影响。

Comments 11 pages, 1 figure, 5 tables, 48 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06840 2026-04-14 cs.CR 50%

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning

MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击

Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08291 2026-04-10 cs.GT cs.CR cs.OS 50%

VCAO: Verifier-Centered Agentic Orchestration for Strategic OS Vulnerability Discovery

VCAO:以验证者为中心的代理协调用于战略操作系统漏洞发现

Suyash Mishra

专题命中 越狱攻击 :safety(abstract)

AI总结 VCAO通过博弈论方法优化操作系统漏洞发现,利用多代理系统在资源约束下实现高效漏洞检测,相比传统方法提升漏洞发现效率并降低误报率。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏