arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2410.02220 2025-02-19 cs.CR cs.AI 57%

Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks

Xiaoqun Liu, Jiacheng Liang, Luoxi Tang, Muchao Ye, Weicheng Ma, Zhaohan Xi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11127 2025-02-18 cs.CR cs.LG cs.MA 57%

G-Safeguard: A Topology-Guided Security Lens and Treatment on LLM-based Multi-agent Systems

Shilong Wang, Guibin Zhang, Miao Yu, Guancheng Wan, Fanci Meng, Chongye Guo, Kun Wang, Yang Wang

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11006 2025-02-18 cs.CR cs.AI 57%

Prompt Inject Detection with Generative Explanation as an Investigative Tool

Jonathan Pan, Swee Liang Wong, Yidi Yuan, Xin Wei Chia

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments 5 pages, 4 tables, 3 diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07959 2025-02-04 cs.AI 57%

Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning

Jiaqi Hua, Wanxu Wei

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08045 2025-01-31 cs.CR cs.AI 57%

Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking

Stav Cohen, Ron Bitton, Ben Nassi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments for Github, see https://github.com/StavC/UnleashingWorms-ExtractingData . arXiv admin note: substantial text overlap with arXiv:2403.02817

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07597 2025-01-15 cs.RO cs.CR cs.LG 57%

Learning-based Detection of GPS Spoofing Attack for Quadrotors

Pengyu Wang, Zhaohua Yang, Jialu Li, Ling Shi

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted in IEEE Industrial Electronics Society Annual Online Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12621 2024-12-18 cs.CL 57%

Jailbreaking? One Step Is Enough!

Weixiong Zheng, Peijian Zeng, Yiwei Li, Hongyan Wu, Nankai Lin, Junhao Chen, Aimin Yang, Yongmei Zhou

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04415 2024-12-06 cs.AI 57%

Targeting the Core: A Simple and Effective Method to Attack RAG-based Agents via Direct LLM Manipulation

Xuying Li, Zhuo Li, Yuji Kosuga, Yasuhiro Yoshida, Victor Bian

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03274 2024-12-03 cs.CR cs.AI 57%

Recent Advances in Attack and Defense Approaches of Large Language Models

Jing Cui, Yishi Xu, Zhewei Huang, Shuchang Zhou, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07130 2024-11-27 cs.AI 57%

Harnessing LLM to Attack LLM-Guarded Text-to-Image Models

Yimo Deng, Huangxun Chen

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 10 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16527 2024-11-19 cs.CR cs.LG 57%

Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis

Jonathan Brokman, Omer Hofman, Oren Rachmil, Inderjeet Singh, Vikas Pahuja, Rathina Sabapathy Aishvariya Priya, Amit Giloni, Roman Vainshtein, Hisashi Kojima

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05056 2024-11-11 cs.CR cs.AI 57%

Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models

Pete Janowczyk, Linda Laurier, Ave Giulietta, Arlo Octavia, Meade Cleti

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01251 2024-11-11 cs.CL 57%

Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling

Yiran Zhao, Wenyue Zheng, Tianle Cai, Xuan Long Do, Kenji Kawaguchi, Anirudh Goyal, Michael Shieh

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13722 2024-10-18 cs.CR cs.AI 57%

Persistent Pre-Training Poisoning of LLMs

Yiming Zhang, Javier Rando, Ivan Evtimov, Jianfeng Chi, Eric Michael Smith, Nicholas Carlini, Florian Tramèr, Daphne Ippolito

专题命中 越狱攻击 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09043 2024-10-16 cs.CR cs.AI 57%

Transforming In-Vehicle Network Intrusion Detection: VAE-based Knowledge Distillation Meets Explainable AI

Muhammet Anil Yagiz, Pedram MohajerAnsari, Mert D. Pese, Polat Goktas

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06462 2024-10-10 cs.CR cs.AI 57%

Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders

David Noever, Forrest McKee

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04447 2024-10-08 cs.CV cs.CR cs.LG 57%

Attention Shift: Steering AI Away from Unsafe Content

Shivank Garg, Manyana Tiwari

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16997 2024-10-08 cs.CL 57%

Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective

Yujian Liu, Yang Zhang, Tommi Jaakkola, Shiyu Chang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10529 2024-08-27 cs.CV cs.AI 57%

Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors

Jiachen Sun, Changsheng Wang, Jiongxiao Wang, Yiwei Zhang, Chaowei Xiao

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03315 2024-08-21 cs.CR cs.AI 57%

Malla: Demystifying Real-world Large Language Model Integrated Malicious Services

Zilong Lin, Jian Cui, Xiaojing Liao, XiaoFeng Wang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Accepted at the 33rd USENIX Security Symposium (USENIX Security '24). The data and code are available at https://github.com/idllresearch/malicious-gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05061 2024-08-12 cs.CR cs.AI 57%

A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares

Stav Cohen, Ron Bitton, Ben Nassi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Website, see https://sites.google.com/view/promptware

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14644 2024-07-29 cs.CL 57%

Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context

Nilanjana Das, Edward Raff, Manas Gaur

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09096 2024-06-13 cs.CL 57%

Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization

Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05119 2024-06-10 cs.LG cs.CV 57%

Compositional Curvature Bounds for Deep Neural Networks

Taha Entesari, Sina Sharifi, Mahyar Fazlyab

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Proceedings of the 41 st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05141 2024-06-07 cs.CR cs.LG 57%

Transferable Availability Poisoning Attacks

Yiyong Liu, Michael Backes, Xiao Zhang

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05311 2024-06-04 cs.LG cs.CR 57%

BruSLeAttack: A Query-Efficient Score-Based Black-Box Sparse Adversarial Attack

Viet Quoc Vo, Ehsan Abbasnejad, Damith C. Ranasinghe

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2024). Code is available at https://brusliattack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02965 2024-06-03 cs.AI cs.RO 57%

Robust Collaborative Perception without External Localization and Clock Devices

Zixing Lei, Zhenyang Ni, Ruize Han, Shuo Tang, Dingju Wang, Chen Feng, Siheng Chen, Yanfeng Wang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

Comments 6pages, accepted to ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11154 2024-05-21 cs.CV cs.AI 57%

Revisiting the Robust Generalization of Adversarial Prompt Tuning

Fan Yang, Mingxuan Xia, Sangzhou Xia, Chicheng Ma, Hui Hui

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03654 2024-05-08 cs.CR cs.AI 57%

Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent

Shang Shang, Xinqiang Zhao, Zhongjiang Yao, Yepeng Yao, Liya Su, Zijing Fan, Xiaodan Zhang, Zhengwei Jiang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05314 2024-04-29 cs.CR cs.AI cs.RO 57%

SoK: On the Semantic AI Security in Autonomous Driving

Junjie Shen, Ningfei Wang, Ziwen Wan, Yunpeng Luo, Takami Sato, Zhisheng Hu, Xinyang Zhang, Shengjian Guo, Zhenyu Zhong, Kang Li, Ziming Zhao, Chunming Qiao, Qi Alfred Chen

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Project website: https://sites.google.com/view/cav-sec/pass

详情

展开后加载摘要…

URL PDF HTML 收藏