arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2505.23706 2025-05-30 cs.NI cs.AI cs.DC cs.IT eess.SP math.IT 57%

Distributed Federated Learning for Vehicular Network Security: Anomaly Detection Benefits and Multi-Domain Attack Threats

Utku Demir, Yalin E. Sagduyu, Tugba Erpek, Hossein Jafari, Sastry Kompella, Mengran Xue

机构 * Nexcepta Inc.(Nexcepta公司) RTX BBN Technologies

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16555 2025-05-30 cs.CL 57%

Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

Yanxu Mao, Peipei Liu, Tiehan Cui, Zhaoteng Yan, Congying Liu, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19773 2025-05-27 cs.CL cs.CR 57%

What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs

Sangyeop Kim, Yohan Lee, Yongwoo Song, Kimin Lee

机构 * Coxwave Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) KAIST(韩国科学技术院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09546 2025-05-26 cs.RO cs.AI 57%

How Secure Are Large Language Models (LLMs) for Navigation in Urban Environments?

Congcong Wen, Jiazhao Liang, Shuaihang Yuan, Hao Huang, Geeta Chandra Raju Bethala, Yu-Shen Liu, Mengyu Wang, Anthony Tzes, Yi Fang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16957 2025-05-23 cs.CR cs.AI 57%

Invisible Prompts, Visible Threats: Malicious Font Injection in External Resources for Large Language Models

Junjie Xiong, Changjia Zhu, Shuhang Lin, Chong Zhang, Yongfeng Zhang, Yao Liu, Lingyao Li

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13076 2025-05-20 cs.CR cs.AI 57%

The Hidden Dangers of Browsing AI Agents

Mykyta Mudryi, Markiyan Chaklosh, Grzegorz Wójcik

机构 * Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院) University of the National Education Commission in Kraków(克拉科夫国家教育委员会大学) Maria Curie-Sklodowska University in Lublin(利沃夫玛丽亚·克里沃斯卡大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12567 2025-05-20 cs.CR cs.AI 57%

A Survey of Attacks on Large Language Models

Wenrui Xu, Keshab K. Parhi

机构 * Department of Electrical and Computer Engineering, University of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09602 2025-05-15 cs.LG cs.CR 57%

Adversarial Suffix Filtering: a Defense Pipeline for LLMs

David Khachaturov, Robert Mullins

机构 * Department of Computer Science and Technology(计算机科学与技术系)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09500 2025-05-15 cs.LG 57%

Layered Unlearning for Adversarial Relearning

Timothy Qian, Vinith Suriyakumar, Ashia Wilson, Dylan Hadfield-Menell

机构 * MIT(麻省理工学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01294 2025-05-13 cs.CL 57%

Endless Jailbreaks with Bijection Learning

Brian R. Y. Huang, Maximilian Li, Leonard Tang

机构 * Haize Labs(哈伊兹实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16721 2025-05-05 cs.CV cs.AI 57%

Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks

Han Wang, Gang Wang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20774 2025-05-01 cs.CR cs.AI 57%

Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-based Decision-Making Systems

Ruochen Jiao, Shaoyuan Xie, Justin Yue, Takami Sato, Lixu Wang, Yixuan Wang, Qi Alfred Chen, Qi Zhu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Accepted paper at ICLR 2025, 31 pages, including main paper, references, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13192 2025-04-25 cs.CR cs.AI 57%

CheatAgent: Attacking LLM-Empowered Recommender Systems via LLM Agent

Liang-bo Ning, Shijie Wang, Wenqi Fan, Qing Li, Xin Xu, Hao Chen, Feiran Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Accepted by KDD 2024;

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10375 2025-04-22 cs.CR cs.DC cs.LG 57%

Foundation Models in Federated Learning: Assessing Backdoor Vulnerabilities

Xi Li, Chen Wu, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Meta The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Xi Li and Chen Wu are equal contribution. The corresponding author is Jiaqi Wang. This paper has been accepted by IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11182 2025-04-16 cs.CR cs.AI 57%

Exploring Backdoor Attack and Defense for LLM-empowered Recommendations

Liangbo Ning, Wenqi Fan, Qing Li

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10374 2025-04-15 cs.LG 57%

Ctrl-Z: Controlling AI Agents via Resampling

Aryan Bhatt, Cody Rushing, Adam Kaufman, Tyler Tracy, Vasil Georgiev, David Matolcsi, Akbir Khan, Buck Shlegeris

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments bashcontrol.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09841 2025-04-15 cs.CR cs.AI 57%

StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models

Yang Feng, Xudong Pan

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13073 2025-04-15 cs.LG cs.CR cs.CV 57%

Let the Noise Speak: Harnessing Noise for a Unified Defense Against Adversarial and Backdoor Attacks

Md Hasan Shahriar, Ning Wang, Naren Ramakrishnan, Y. Thomas Hou, Wenjing Lou

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03230 2025-04-04 cs.CR cs.LG 57%

Defending Large Language Models Against Attacks With Residual Stream Activation Analysis

Amelia Kawasaki, Andrew Davis, Houssam Abbas

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Included in Proceedings of the Conference on Applied Machine Learning in Information Security (CAMLIS 2024), Arlington, Virginia, USA, October 24-25, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01705 2025-04-01 cs.CR cs.CL 57%

Data Extraction Attacks in Retrieval-Augmented Generation via Backdoors

Yuefeng Peng, Junda Wang, Hong Yu, Amir Houmansadr

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13419 2025-03-18 cs.CR cs.AI cs.ET cs.HC 57%

Securing Virtual Reality Experiences: Unveiling and Tackling Cybersickness Attacks with Explainable AI

Ripan Kumar Kundu, Matthew Denton, Genova Mongalo, Prasad Calyam, Khaza Anuarul Hoque

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10800 2025-03-14 cs.LG cs.CR 57%

Jailbreaking Large Language Models in Infinitely Many Ways

Oliver Goldstein, Emanuele La Malfa, Felix Drinkall, Samuele Marro, Michael Wooldridge

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08195 2025-03-12 cs.CL 57%

Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation

Wenlong Meng, Fan Zhang, Wendao Yao, Zhenyuan Guo, Yuwei Li, Chengkun Wei, Wenzhi Chen

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01229 2025-03-04 cs.LG cs.CR cs.SY eess.SY 57%

Enhancing Network Security Management in Water Systems using FM-based Attack Attribution

Aleksandar Avdalovic, Joseph Khoury, Ahmad Taha, Elias Bou-Harb

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14866 2025-03-04 cs.CR cs.AI 57%

PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs

Xueluan Gong, Mingzhe Li, Yilin Zhang, Fengyuan Ran, Chen Chen, Yanjiao Chen, Qian Wang, Kwok-Yan Lam

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09154 2025-03-04 cs.LG 57%

Attacking Large Language Models with Projected Gradient Descent

Simon Geisler, Tom Wollschläger, M. H. I. Abdalla, Johannes Gasteiger, Stephan Günnemann

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20952 2025-03-03 cs.CR cs.LG 57%

Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content

Hongyuan Shen, Min Zheng, Jincheng Wang, Yang Zhao

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18518 2025-02-27 cs.CR cs.AI 57%

Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs

Peng Yifeng, Wu Zhizheng, Chen Chen

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15576 2025-02-24 cs.CL 57%

Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders

Xuansheng Wu, Jiayi Yuan, Wenlin Yao, Xiaoming Zhai, Ninghao Liu

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments Pre-print. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15017 2025-02-24 cs.LG cs.CR 57%

Interpreting Adversarial Attacks and Defences using Architectures with Enhanced Interpretability

Akshay G Rao, Chandrashekhar Lakshminarayanan, Arun Rajkumar

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

Comments Publication accepted at AAAI Deployable AI conference 2025 (proof - accepted-papers?authuser=0" target="_blank" rel="noopener">https://sites.google.com/view/dai-2025/accepted-papers?authuser=0) Total 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏