arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-17 至 2025-09-17 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2509.12221 2025-09-17 cs.LG cs.AI cs.CL cs.CR 75%

MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors

Xin Tong, Zhi Lin, Jingya Wang, Meng Han, Bo Jin

机构 * Xin Tong School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Zhi Lin School of Safety Science Tsinghua University(安全科学学院 清华大学) Jingya Wang School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Meng Han Intelligent Fusion Research Center Zhejiang University(智能融合研究中心 浙江大学) Bo Jin* The Third Research Institute of the Ministry of Public Security of China(中华人民共和国公安部第三研究所)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12937 2025-09-17 cs.CR cs.AI cs.CL 73%

Jailbreaking Large Language Models Through Content Concretization

Johan Wahréus, Ahmed Hussain, Panos Papadimitratos

机构 * Networked Systems Security (NSS) Group(网络系统安全组) KTH Royal Institute of Technology(皇家理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted for presentation in the Conference on Game Theory and AI for Security (GameSec) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12724 2025-09-17 cs.CV cs.AI 70%

Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models

Yunhan Zhao, Xiang Zheng, Xingjun Ma

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13266 2025-09-17 cs.LG cs.AI 62%

JANUS: A Dual-Constraint Generative Framework for Stealthy Node Injection Attacks

Jiahao Zhang, Xiaobing Pei, Zhaokun Zhong, Wenqiang Hao, Zhenghao Tang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02844 2025-09-17 cs.CV cs.CL cs.CR 57%

Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection

Ziqi Miao, Yi Ding, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main). 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15244 2025-09-17 cs.CV cs.AI 57%

Adversarial Prompt Distillation for Vision-Language Models

Lin Luo, Xin Wang, Bojia Zi, Shihao Zhao, Xingjun Ma, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理实验室,计算机科学学院,复旦大学) The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学,沙田,香港) The University of Hong Kong, Pokfulam, Hong Kong(香港大学,薄扶林,香港)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏