arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-18 至 2025-11-18 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 11 篇

2511.12217 2025-11-18 cs.LG 83%

AlignTree: Efficient Defense Against LLM Jailbreak Attacks

Gil Goren, Shahar Katz, Lior Wolf

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.LG

Comments Accepted as an Oral Presentation at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22564 2025-11-18 cs.CL cs.AI cs.LG 82%

Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs

Xikang Yang, Biyu Zhou, Xuehai Tang, Jizhong Han, Songlin Hu

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06194 2025-11-18 cs.CL 79%

SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation

Lai Jiang, Yuekang Li, Xiaohan Zhang, Youtao Ding, Li Pan

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

Comments This paper has been accepted by AAAI 2026 as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13548 2025-11-18 cs.CR cs.AI cs.CL 73%

ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models

Siyang Cheng, Gaotian Liu, Rui Mei, Yilin Wang, Kejia Zhang, Kaishuo Wei, Yuqi Yu, Weiping Wen, Xiaojie Wu, Junhua Liu

机构 * iFLYTEK Security Laboratory(iFLYTEK安全实验室) Anhui SparkShield Intelligent Technology Co., Ltd.(安徽SparkShield智能科技有限公司) Peking University(北京大学) School of Automation, University of Electronic Science and Technology of China(电子科技大学自动化学院) Northwest University(西北大学) University of New South Wales(新南威尔士大学) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术处置协调中心)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01223 2025-11-18 cs.CR cs.CL 70%

Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge

Ning Xu, Bo Gao, Hui Dou

机构 * School of Computer Science and Technology(计算机科学与技术学院) AnHui University(安徽大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12782 2025-11-18 cs.CL cs.CR 70%

LLM Reinforcement in Context

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17089 2025-11-18 cs.CL 70%

Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Ye Wang, Gang Tan, Shagufta Mehnaz

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 19 pages, 5 figures. Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12648 2025-11-18 cs.CR cs.AI cs.LG 62%

Scalable Hierarchical AI-Blockchain Framework for Real-Time Anomaly Detection in Large-Scale Autonomous Vehicle Networks

Rathin Chandra Shit, Sharmila Subudhi

机构 * organization= Dept. of Computer Science \& Engg., International Institute of Information Technology , city= Bhubaneswar , postcode= 751003 , state= Odisha , country= India organization= Dept. of Computer Science, Maharaja Sriram Chandra Bhanja Deo University , city= Baripada , postcode= 757003 , state= Odisha , country= India

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments Submitted to the Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12423 2025-11-18 cs.CR cs.LG 57%

GRAPHTEXTACK: A Realistic Black-Box Node Injection Attack on LLM-Enhanced GNNs

Jiaji Ma, Puja Trivedi, Danai Koutra

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12149 2025-11-18 cs.CR cs.AI cs.CV 57%

AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models

Jiayu Li, Yunhan Zhao, Xiang Zheng, Zonghuan Xu, Yige Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11961 2025-11-18 cs.HC 50%

"Power of Words": Stealthy and Adaptive Private Information Elicitation via LLM Communication Strategies

Shuning Zhang, Jiaqi Bai, Linzhi Wang, Shixuan Li, Xin Yi, Hewu Li

专题命中 越狱攻击 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏