arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2602.16520 2026-02-19 cs.CR cs.AI 79%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02649 2026-02-18 cs.AI 79%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05877 2026-02-06 cs.AI cs.HC 79%

Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy

安全关键型LLM助手中的Agent2Agent威胁:以人为中心的分类

Lukas Stappen, Ahmet Erkan Turan, Johann Hagerer, Georg Groh

机构 * BMW Group Research(宝马集团研究) Technical University Munich(慕尼黑技术大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AgentHeLLM框架,通过分离资产识别与攻击路径分析,为安全关键型LLM助手提供以人为中心的威胁建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12460 2026-01-21 cs.CR cs.LG 79%

TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning

TrojanPraise: 通过良性微调劫持LLM

Zhixin Xie, Xurui Song, Jun Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05742 2026-01-12 cs.CR cs.AI 79%

The Echo Chamber Multi-Turn LLM Jailbreak

回声室多轮LLM劫持

Ahmad Alobaid, Martí Jordà Roca, Carlos Castillo, Joan Vendrell

机构 * NeuralTrust ICREA and UPF(ICREA和UPF)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22488 2025-12-30 cs.LG cs.CV 79%

Toward Real-World IoT Security: Concept Drift-Resilient IoT Botnet Detection via Latent Space Representation Learning and Alignment

迈向现实世界的物联网安全:通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测

Hassan Wasswa, Timothy Lynar

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测框架,有效解决传统方法在动态环境中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11783 2025-12-15 cs.CR cs.AI 79%

Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously

超后缀:同时绕过文本生成对齐和防护模型

Andrew Adiletta, Kathryn Adiletta, Kemal Derya, Berk Sunar

机构 * MITRE(MITRE公司) Worcester Polytechnic Institute(沃斯顿理工学院)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出超后缀技术,通过联合优化绕过Llama Prompt Guard 2,同时提出DeltaGuard检测方法提升对抗性提示防御效果。

Comments 13 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05248 2025-11-24 cs.CL 79%

Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models

响应攻击:利用上下文优先级来劫持大语言模型

Ziqi Miao, Lijun Li, Yuan Xiong, Zhenhua Liu, Pengyu Zhu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 响应攻击通过利用对话中中间响应作为上下文优先级,有效劫持大语言模型生成违反政策的内容。

Comments 20 pages, 10 figures. Code and data available at https://github.com/Dtc7w3PQ/Response-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06194 2025-11-18 cs.CL 79%

SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation

Lai Jiang, Yuekang Li, Xiaohan Zhang, Youtao Ding, Li Pan

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

Comments This paper has been accepted by AAAI 2026 as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07480 2025-11-12 cs.CR cs.AI 79%

KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs

Shuyuan Liu, Jiawei Chen, Xiao Yang, Hang Su, Zhaoxia Yin

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03271 2025-11-06 cs.CR cs.CL 79%

Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs

Yize Liu, Yunyun Hou, Aina Sui

专题命中 越狱攻击 :jailbreak(title);red teaming(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00556 2025-11-04 cs.CL 79%

Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack

Peng Ding, Jun Kuang, Wen Sun, Zongyu Wang, Xuezhi Cao, Xunliang Cai, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Meituan Inc.(美团公司)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

Comments Preprint, 14 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18728 2025-10-22 cs.CR cs.AI 79%

HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models

Sidhant Narula, Javad Rafiei Asl, Mohammad Ghasemigol, Eduardo Blanco, Daniel Takabi

机构 * University of Arizona(亚利桑那大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments This paper has been accepted for presentation at the Conference on Applied Machine Learning in Information Security (CAMLIS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09023 2025-10-13 cs.LG cs.CR 79%

The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections

Milad Nasr, Nicholas Carlini, Chawin Sitawarin, Sander V. Schulhoff, Jamie Hayes, Michael Ilie, Juliette Pluto, Shuang Song, Harsh Chaudhari, Ilia Shumailov, Abhradeep Thakurta, Kai Yuanqing Xiao, Andreas Terzis, Florian Tramèr

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) HackAPrompt Northeastern University(东北大学) ETH Zürich(苏黎世联邦理工学院) AI Sequrity Company(AI安全公司) MATS Main contributors(MATS主要贡献者)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06594 2025-10-13 cs.CL 79%

Do Internal Layers of LLMs Reveal Patterns for Jailbreak Detection?

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * Dept. of Computer Science and Engineering University of California, Riverside(计算机科学与工程系加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20848 2025-08-29 cs.CR cs.AI 79%

JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring

Junjie Chu, Mingjie Li, Ziqing Yang, Ye Leng, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments 17 pages, 5 figures. For the code and data supporting this work, see https://trustairlab.github.io/jades.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05934 2025-08-19 cs.CR cs.AI 79%

Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models

Ma Teng, Jia Xiaojun, Duan Ranjie, Li Xinfeng, Huang Yihao, Jia Xiaoshuang, Chu Zhixuan, Ren Wenqi

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03054 2025-08-06 cs.AI 79%

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning

Rui Pu, Chaozhuo Li, Rui Ha, Litian Zhang, Lirong Qiu, Xi Zhang

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE)(可信分布式计算与服务重点实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02581 2025-07-25 cs.AI 79%

Neurodivergent Influenceability as a Contingent Solution to the AI Alignment Problem

Alberto Hernández-Espinosa, Felipe S. Abrahão, Olaf Witkowski, Hector Zenil

机构 * Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新) London Institute for Healthcare Engineering(伦敦医疗工程研究所) University of Tokyo(东京大学) The Arrival Institute(抵达研究所) Cancer Research Group(癌症研究组) The Francis Crick Institute(弗朗西斯·克里克研究所) Cross Labs(交叉实验室) King’s Institute for Artificial Intelligence(国王人工智能研究所) King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09164 2025-07-23 cs.CR cs.AI 79%

ShadowCode: Towards (Automatic) External Prompt Injection Attack against Code LLMs

Yuchen Yang, Yiming Li, Hongwei Yao, Bingrun Yang, Yiling He, Tianwei Zhang, Dacheng Tao, Zhan Qin

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新区(滨江)区块链与数据安全研究院,杭州) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08862 2025-07-15 cs.CR cs.CL 79%

RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation

Tianzhe Zhao, Jiaoyan Chen, Yanchi Ru, Haiping Zhu, Nan Hu, Jun Liu, Qika Lin

机构 * School of Computer Science and Technology,Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00841 2025-07-02 cs.AI cs.CR 79%

SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents

Siyuan Liang, Tianmeng Fang, Zhe Liu, Aishan Liu, Yan Xiao, Jinyuan He, Ee-Chien Chang, Xiaochun Cao

机构 * Nanyang Technological University(南洋理工大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Beihang University(北京航空航天大学) Sun Yat-sen University(中山大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16155 2025-06-27 cs.CL 79%

A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns

Tianyi Men, Pengfei Cao, Zhuoran Jin, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与复杂系统决策智能重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10022 2025-06-13 cs.CR cs.AI 79%

LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges

Haoyang Li, Huan Gao, Zhiyuan Zhao, Zhiyu Lin, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Beihang University(北京航空航天大学) Beijing Jiaotong University(北京交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments Accepted as ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14316 2025-05-21 cs.CR cs.AI 79%

Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion

Tiehan Cui, Yanxu Mao, Peipei Liu, Congying Liu, Datao You

机构 * Zhongguancun Laboratory(中关村实验室) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20493 2025-04-30 cs.CR cs.AI 79%

Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression

Yu Cui, Yujun Cai, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16489 2025-04-24 cs.CR cs.AI 79%

Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate

Senmao Qi, Yifei Zou, Peng Li, Ziyi Lin, Xiuzhen Cheng, Dongxiao Yu

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19672 2025-02-28 cs.CV cs.LG 79%

Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack

Chenhe Gu, Jindong Gu, Andong Hua, Yao Qin

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2403.09766

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13148 2025-02-25 cs.LG cs.CR 79%

Defending Jailbreak Prompts via In-Context Adversarial Game

Yujun Zhou, Yufei Han, Haomin Zhuang, Kehan Guo, Zhenwen Liang, Hongyan Bao, Xiangliang Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

Comments EMNLP 2024 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08754 2025-02-19 cs.CL cs.CR 79%

StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures

Bangxin Li, Hengrui Xing, Cong Tian, Chao Huang, Jin Qian, Huangqing Xiao, Linfeng Feng

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏