arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2102.08111 2021-11-30 stat.AP cs.LG cs.SY eess.SY 57%

Multivariable Fractional Polynomials for lithium-ion batteries degradation models under dynamic conditions

Clara Bertinelli Salucci, Azzeddine Bakdi, Ingrid K. Glad, Erik Vanem, Riccardo De Bin

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 45 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05825 2021-09-29 cs.CR cs.AR cs.LG 57%

HASI: Hardware-Accelerated Stochastic Inference, A Defense Against Adversarial Machine Learning Attacks

Mohammad Hossein Samavatian, Saikat Majumdar, Kristin Barber, Radu Teodorescu

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Journal ref Secure and Private Systems for Machine Learning Workshop 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04990 2021-09-16 cs.CL 57%

Perturbing Inputs for Fragile Interpretations in Deep Natural Language Processing

Sanchit Sinha, Hanjie Chen, Arshdeep Sekhon, Yangfeng Ji, Yanjun Qi

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

Comments EMNLP-BlackboxNLP, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01746 2021-08-10 cs.LG 57%

Data-driven Operation of the Resilient Electric Grid: A Case of COVID-19

Hossein Noorazar, Anurag. k. Srivastava, K. Sadanandan Sajan, Sanjeev Pannala

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.14100 2021-07-30 cs.CY 57%

Smart Band: An Integrated Device for Emergency Management

A. Jackulin Mahariba, Shivam Patel

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

Comments 3 pages, 6 figures

Journal ref International Journal of Engineering and Advanced Technology, Volume-8 Issue-4S2, April 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07110 2021-03-15 cs.CR cs.AI 57%

Explaining Network Intrusion Detection System Using Explainable AI Framework

Shraddha Mane, Dattaraj Rao

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02132 2020-11-30 cs.CV cs.CR cs.LG cs.RO 57%

SADA: Semantic Adversarial Diagnostic Attacks for Autonomous Applications

Abdullah Hamdi, Matthias Müller, Bernard Ghanem

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted at AAAI'20

Journal ref AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.00540 2020-11-03 cs.CR cs.LG 57%

Unsupervised Intrusion Detection System for Unmanned Aerial Vehicle with Less Labeling Effort

Kyung Ho Park, Eunji Park, Huy Kang Kim

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 14 pages, 4 tables, 3 figures, 5 equations, In Proceeding of WISA 2020 (THE 21ST WORLD CONFERENCE ON INFORMATION SECURITY APPLICATIONS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.14137 2020-05-29 cs.LG cs.CV stat.ML 57%

QEBA: Query-Efficient Boundary-Based Blackbox Attack

Huichen Li, Xiaojun Xu, Xiaolu Zhang, Shuang Yang, Bo Li

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted by CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08072 2019-10-10 cs.LG cs.CR stat.ML 57%

Adversarial Attacks and Defenses in Images, Graphs and Text: A Review

Han Xu, Yao Ma, Haochen Liu, Debayan Deb, Hui Liu, Jiliang Tang, Anil K. Jain

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments survey, adversarial attacks, defenses

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11129 2019-07-26 cs.LG cs.CR cs.NE stat.AP stat.ML 57%

Semisupervised Adversarial Neural Networks for Cyber Security Transfer Learning

Casey Kneale, Kolia Sadeghi

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

Comments 14 figures, 17 pages, Draft

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.07077 2019-06-18 cs.LG cs.CR stat.ML 57%

The Attack Generator: A Systematic Approach Towards Constructing Adversarial Attacks

Felix Assion, Peter Schlicht, Florens Greßner, Wiebke Günther, Fabian Hüger, Nico Schmidt, Umair Rasheed

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments CVPR SAIAD - Workshop 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.05810 2019-05-02 cs.CV cs.CR cs.LG stat.ML 57%

ShapeShifter: Robust Physical Adversarial Attack on Faster R-CNN Object Detector

Shang-Tse Chen, Cory Cornelius, Jason Martin, Duen Horng Chau

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Journal ref Joint European Conference on Machine Learning and Knowledge Discovery in Databases, pp. 52-68, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02575 2018-12-08 stat.ML cs.CR cs.LG 57%

Prior Networks for Detection of Adversarial Attacks

Andrey Malinin, Mark Gales

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03423 2018-02-09 stat.ML cs.LG 57%

Ensemble Methods as a Defense to Adversarial Perturbations Against Deep Neural Networks

Thilo Strauss, Markus Hanselmann, Andrej Junginger, Holger Ulmer

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.05934 2017-11-17 cs.CV cs.CR cs.LG 57%

Enhanced Attacks on Defensively Distilled Deep Neural Networks

Yujia Liu, Weiming Zhang, Shaohua Li, Nenghai Yu

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00814 2017-10-04 cs.CV cs.CR cs.LG 57%

Detecting Adversarial Attacks on Neural Network Policies with Visual Foresight

Yen-Chen Lin, Ming-Yu Liu, Min Sun, Jia-Bin Huang

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Project page: http://yclin.me/RL_attack_detection/ Code: https://github.com/yenchenlin/rl-attack-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01606 2024-07-03 cs.LG cs.AI cs.CL cs.CV stat.ML 56%

On Discrete Prompt Optimization for Diffusion Models

Ruochen Wang, Ting Liu, Cho-Jui Hsieh, Boqing Gong

专题命中 越狱攻击 :分类 cs.CL、cs.AI、cs.LG;DPO(comments)

Comments ICML 2024. Code available at https://github.com/ruocwang/dpo-diffusion

Journal ref Proceedings of the 41st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-08-25 cs.CR 版本更新 50%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 越狱攻击 :safety(abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20748 2026-08-24 cs.CV 新提交 50%

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

为视觉几何接地Transformer生成多视角对抗样本

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本研究针对3D基础模型VGGT的安全漏洞,提出MVAP-G多视角对抗扰动生成器,通过跨视角对抗对齐机制生成一致扰动,可无需迭代优化即可显著降低VGGT性能,为3D视觉系统鲁棒性研究提供了新方向。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19135 2026-08-20 cs.CR cs.DC cs.MA cs.NI 新提交 50%

Autonomous Cyber Defense in Connected Vehicles: A Multi-Agent Approach to V2X Security

网联车辆中的自主网络防御:一种面向V2X安全的多智能体方法

Krishna Teja Medam

专题命中 越狱攻击 :safety(abstract)

AI总结 针对网联车辆V2X安全,提出三层多智能体架构,以SAE标准时序为硬性约束,分层处理消息分类、冲突解决与模型优化,解决现有入侵检测系统的安全-安保冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13671 2026-08-17 cs.CV 新提交 50%

PROVE: Training-Free Prompt Recovery using Verifiable Evidence

PROVE:基于可验证证据的无训练提示词恢复

Rupayan Mallick, Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 越狱攻击 :alignment(abstract)

AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 50%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 50%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20851 2026-08-05 cs.CV 版本更新 50%

Poisoning Prompt-Guided Sampling in Video Large Language Models

针对视频大语言模型中提示引导采样的投毒攻击

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01117 2026-08-04 cs.CR 新提交 50%

SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks

SoK:面向意图的多轮大语言模型越狱系统化研究

Siyuan Li, Aodu Wulianghai, Zehao Liu, Xi Lin, Qinghua Mao, Haoyu Li, Xiang Chen, Siyuan Liang, Jun Wu, Jianhua Li, Dacheng Tao

专题命中 越狱攻击 :safety(abstract)

AI总结 本研究提出面向意图的多轮LLM越狱分类法,发现攻击有效性取决于意图组织精细度,推动检测范围升级,表明轮级安全机制不足,需对应层级评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 50%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 越狱攻击 :alignment(abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21243 2026-07-24 cs.CV 新提交 50%

Detectors Learn the Wrong Thing: Shortcut-Resistant Adversarial Training Against Physically Realizable Attacks

检测器学习到错误的东西:针对物理可实现攻击的抗捷径对抗训练

Yuanhao Huang, Yilong Ren, Jinlei Wang, Xuesong Bai, Zheng Zhang, Haiyang Yu

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Lab of Intelligent Transportation System(智能交通系统国家重点实验室) Zhongguancun Laboratory(中关村实验室) School of Systems Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院) Shandong Sino-Aisa Tire Proving Ground Co.,Ltd.(山东中亚洲轮胎试验场有限公司)

专题命中 越狱攻击 :safety(abstract)

AI总结 研究针对物理可实现攻击,提出实例级对比对抗训练框架InsCAT,通过SICA、ROPO和Guard等方法防止检测器将对抗纹理用作独立决策线索,经实验验证其在多场景和检测器上效果良好,提升检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19545 2026-07-23 cs.CR 新提交 50%

When HTTP 402 Meets the Blockchain: Risks on Emerging x402 Payments

当HTTP 402遇上区块链:新兴x402支付的风险

Qinying Wang, Yong Yang, Yuan Chen, Shouling Ji, Mathias Payer

专题命中 越狱攻击 :safety(abstract)

AI总结 研究x402支付协议,通过系统研究确定促进者的安全规则,基于规则违规分析得出新攻击向量,提出半自动黑盒工具评估安全性,发现部署均有违规,还通过实证测量量化相关指标,揭示其安全风险。

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 50%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 越狱攻击 :alignment(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏