arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2408.07291 2026-04-08 cs.CR 50%

Evaluating LLM-based Personal Information Extraction and Countermeasures

评估基于大语言模型的个人信息提取及应对措施

Yupei Liu, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究评估了基于大语言模型的个人信息提取技术及防御策略,通过系统测量研究对比了多种方法的性能,发现大语言模型在提取个人信息上表现优异,但通过提示注入可有效防御其攻击。

Comments USENIX Security Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00446 2026-04-07 cs.CR 50%

Exposing the Ghost in the Transformer: Abnormal Detection for Large Language Models via Hidden State Forensics

揭示Transformer中的幽灵:通过隐藏状态取证实现大语言模型的异常检测

Shide Zhou, Kailong Wang, Ling Shi, Haoyu Wang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 本文提出通过隐藏状态取证检测大语言模型异常行为,实现实时高效的安全威胁识别,检测准确率超95%,计算开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30034 2026-04-01 cs.CR 50%

EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method

EnsembleSHAP:为随机子空间方法提供可信且可验证的属性分配

Yanting Wang, Jinyuan Jia

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 本文提出EnsembleSHAP,为随机子空间方法提供高效且安全的特征属性分配,具备本地准确性并能抵御隐私保护攻击,首次证明了对解释保护攻击的鲁棒性。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20863 2026-03-31 cs.CR 50%

Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks

通过隐藏提示注入攻击误导用于科学同行评审的大型语言模型

Matteo Gioele Collu, Umberto Salviati, Roberto Confalonieri, Mauro Conti, Giovanni Apruzzese

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究探讨了通过隐藏提示注入攻击误导科学同行评审中使用的大型语言模型的潜力,设计了不可见于人类读者但能引导LLM输出的对抗性提示,并评估了其在不同系统和论文中的鲁棒性。

Comments Accepted to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14332 2026-03-23 cs.CR 50%

Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use

动态能力治理:用于AI代理工具使用的加密绑定与可重复性验证

Ziling Zhou

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出三种代理治理要求,通过加密绑定和可重复性验证解决AI代理动态能力验证问题,证明两个结构定理并验证两种加密方案,展示低开销和高安全性。

Comments 23 pages, 5 figures, 18 tables. Includes 11 experiments, 9 formal security properties, and appendix with proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17459 2026-03-19 cs.RO 50%

P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation

P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航

Tianfu Li, Wenbo Chen, Haoxuan Xu, Xinhu Zheng, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 越狱攻击 :alignment(abstract)

AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 50%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07384 2026-03-10 quant-ph 50%

Machine Learning Techniques for Enhancing Quantum Key Distribution

用于增强量子密钥分配的机器学习技术

Ali Al-Kuwari, Safaa Alqrinawi, Lujayn Al-Amir, Amina Mollazehi, Saif Al-Kuwari

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文综述了机器学习技术在提升量子密钥分配系统安全性和性能方面的应用,涵盖参数优化、攻击检测、协议选择、密钥性能预测和量子网络管理等五个方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 越狱攻击 :harmlessness(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23397 2026-03-02 cs.CR cs.SY eess.SY 50%

Lifecycle-Integrated Security for AI-Cloud Convergence in Cyber-Physical Infrastructure

面向AI-云融合的生命周期集成安全机制:用于网络物理基础设施

S M Zia Ur Rashid, Deepa Gurung, Sonam Raj Gupta, Suman Rath

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出了一种生命周期集成的安全架构,通过综合AI治理、云安全和工业标准,实现对AI-云融合环境中多层攻击的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18079 2026-02-23 cs.CR cs.RO 50%

Dynamic Deception: When Pedestrians Team Up to Fool Autonomous Cars

动态欺骗:当行人联手欺骗自动驾驶汽车

Masoud Jamshidiyan Tehrani, Marco Gabriel, Jinhan Kim, Paolo Tonella

机构 * Università della Svizzera italiana(瑞士意大利大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出通过多个动态元素协作放大对抗信号,以引发自动驾驶车辆的系统级故障,展示动态协作在对抗攻击中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01068 2026-02-17 cs.CR 50%

Post-Quantum Cryptography for Intelligent Transportation Systems: An Implementation-Focused Review

面向智能交通系统的后量子密码学:一项以实现为导向的综述

Abdullah Al Mamun, Akid Abrar, Mizanur Rahman, M Sabbir Salek, Mashrur Chowdhury

专题命中 越狱攻击 :safety(abstract)

AI总结 本文综述了智能交通系统中后量子密码学的实现挑战与未来研究方向,旨在提升ITS在量子计算时代的安全性和可靠性。

Comments This is a preprint version of a manuscript currently under second-round peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06630 2026-02-09 cs.CR 50%

TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking

TrapSuffix: 对抗对抗性后缀的主动防御在劫持中

Mengyao Du, Han Fang, Haokai Ma, Gang Yang, Quanjun Yin, Shouling Ji, Ee-Chien Chang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 TrapSuffix通过主动防御机制,使攻击者陷入无赢困境,有效降低劫持攻击成功率并提高可追溯性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03489 2026-02-04 cs.CR 50%

Detecting and Explaining Malware Family Evolution Using Rule-Based Drift Analysis

基于规则的漂移分析检测和解释恶意软件家族演变

Olha Jurečková, Martin Jureček

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出基于规则的漂移分析方法,用于检测和解释恶意软件家族演变,通过比较规则集识别特征变化,提供可操作的恶意软件行为洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01290 2026-02-03 cs.NI 50%

AOASS: Adaptive Obstacle-Aware Square Spiral Framework for Single-mobile Anchor-Based WSN Localization

AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位

Abdelhady Naguib

专题命中 越狱攻击 :safety(abstract)

AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21380 2026-01-30 cs.CR 50%

RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing

RerouteGuard: 理解并缓解LLM路由中的对抗风险

Wenhui Zhang, Huiyu Xu, Zhibo Wang, Zhichao Li, Zeqing He, Xuelin Wei, Kui Ren

专题命中 越狱攻击 :safety(abstract)

AI总结 RerouteGuard通过动态嵌入检测和自适应阈值,有效检测并缓解LLM路由中的对抗风险,提升多模型AI系统的安全性。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19051 2026-01-28 cs.CR 50%

Proactive Hardening of LLM Defenses with HASTE

通过HASTE主动增强LLM防御

Henry Chen, Victor Aranda, Samarth Keshari, Ryan Heartfield, Nicole Nichols

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 HASTE通过主动生成对抗样本提升LLM防御效果,有效降低基线检测器误报率并优化检测模型性能。

Comments Accepted at peer review NDSS 2026, Last-X workshop. Camera ready copy forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 越狱攻击 :alignment(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 50%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 越狱攻击 :alignment(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 50%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 越狱攻击 :alignment(abstract)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20290 2026-01-01 cs.CR 50%

APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training

APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎

Xuebo Qiu, Mingqi Lv, Yimei Zhang, Tieming Chen, Tiantian Zhu, Qijie Song, Shouling Ji

专题命中 越狱攻击 :alignment(abstract)

AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。

Comments Accepted by SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18536 2026-01-01 cs.IR 50%

Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges

相关性错觉:任意内容注入攻击欺骗检索器、重排序器和LLM判断者

Manveer Singh Tamber, Jimmy Lin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文揭示了任意内容注入攻击可欺骗检索器、重排序器和LLM判断者,指出模型在安全性和鲁棒性上的弱点,并呼吁进一步研究。

Comments AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15790 2025-12-19 cs.CR 50%

Bilevel Optimization for Covert Memory Tampering in Heterogeneous Multi-Agent Architectures (XAMT)

针对异构多智能体架构中的隐蔽内存篡改的双层优化

Akhil Sharma, Shaikh Yaser Arafat, Jai Kumar Sharma, Ken Huang

专题命中 越狱攻击 :safety(abstract)

AI总结 XAMT通过双层优化方法针对异构多智能体架构中的隐蔽内存篡改问题,提出了一种新的训练时威胁模型,以提升系统安全性。

Comments 10 pages, 5 figures, 4 tables. Conference-style paper (IEEEtran). Proposes unified bilevel optimization framework for covert memory poisoning attacks in heterogeneous multi-agent systems (MARL + RAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19312 2025-12-16 cs.HC 50%

Human-AI Teaming Under Deception: An Implicit BCI Safeguards Drone Team Performance in Virtual Reality

人类与人工智能协同工作中的欺骗:一种隐式脑机接口保护虚拟现实中的无人机团队性能

Christopher Baker, Stephen Hinton, Akashdeep Nijjar, Riccardo Poli, Caterina Cinel, Tom Reed, Stephen Fairclough

专题命中 越狱攻击 :safety(abstract)

AI总结 隐式脑机接口通过解耦神经信号与行为,提升虚拟现实无人机团队在AI欺骗下的鲁棒性与安全性。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15316 2025-11-20 cs.CV 50%

What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs

Zhihan Ren, Lijun He, Jiaxi Liang, Xinzhu Fu, Haixia Bi, Fan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13535 2025-11-19 cs.CV 50%

Accuracy is Not Enough: Poisoning Interpretability in Federated Learning via Color Skew

Farhin Farhad Riya, Shahinul Hoque, Jinyuan Stella Sun, Olivera Kotevska

专题命中 越狱攻击 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11961 2025-11-18 cs.HC 50%

"Power of Words": Stealthy and Adaptive Private Information Elicitation via LLM Communication Strategies

Shuning Zhang, Jiaqi Bai, Linzhi Wang, Shixuan Li, Xin Yi, Hewu Li

专题命中 越狱攻击 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07315 2025-11-11 cs.CR 50%

JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework

Yuxuan Zhou, Yang Bai, Kuofeng Gao, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24034 2025-10-29 cs.CV 50%

AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts

Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang, Xiaojun Jia, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学网络空间学院) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19911 2025-10-28 cs.CV 50%

Attention! Your Vision Language Model Could Be Maliciously Manipulated

Xiaosen Wang, Shaokang Wang, Zhijin Ge, Yuyang Luo, Shudong Zhang

专题命中 越狱攻击 :trustworthy(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏