arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2602.13547 2026-02-17 cs.CR cs.AI 88%

AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks

AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识

Weiming Song, Xuan Xie, Ruiping Yin

机构 * Beijing University of Technology(北京理工大学) Macau University of Science and Technology(澳门科技大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.AI

AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22067 2026-02-17 cs.LG cs.AI 86%

The Rogue Scalpel: Activation Steering Compromises LLM Safety

恶意手术刀:激活引导破坏了大语言模型的安全性

Anton Korznikov, Andrey Galichin, Alexey Dontsov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13321 2026-02-17 cs.AI cs.LG 84%

Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction

通过自动化语言特征提取检测临床训练LLM中的劫持尝试

Tri Nguyen, Huy Hoang Bao Le, Lohith Srikanth Pentapalli, Laurah Turner, Kelly Cohen

机构 * University of Cincinnati(克利夫兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过自动化语言特征提取,利用BERT模型预测四个核心语言特征,以检测临床训练LLM中的劫持尝试,验证了该方法的有效性及可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07107 2026-02-17 cs.CR cs.AI 77%

ShallowJail: Steering Jailbreaks against Large Language Models

ShallowJail: 对大语言模型的对抗性攻击

Shang Liu, Hanyu Pei, Zeyan Liu

机构 * xxx

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 ShallowJail通过操纵LLMs的初始标记来攻击其对齐机制,从而降低大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00187 2026-02-17 cs.CL cs.CR cs.LG 73%

Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks

引导对话动态以对抗多轮劫持攻击

Hanjiang Hu, Alexander Robey, Changliu Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于安全控制理论的神经屏障函数,通过状态空间建模和安全预测器,有效防御多轮劫持攻击,提升对话安全性与实用性。

Comments TMLR, 31 pages, 11 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI 57%

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 57%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01068 2026-02-17 cs.CR 50%

Post-Quantum Cryptography for Intelligent Transportation Systems: An Implementation-Focused Review

面向智能交通系统的后量子密码学:一项以实现为导向的综述

Abdullah Al Mamun, Akid Abrar, Mizanur Rahman, M Sabbir Salek, Mashrur Chowdhury

专题命中 越狱攻击 :safety(abstract)

AI总结 本文综述了智能交通系统中后量子密码学的实现挑战与未来研究方向,旨在提升ITS在量子计算时代的安全性和可靠性。

Comments This is a preprint version of a manuscript currently under second-round peer review

详情

展开后加载摘要…

URL PDF HTML 收藏