arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-08 至 2026-01-08 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2601.03600 2026-01-08 cs.LG cs.AI cs.IR 86%

ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification

ALERT: 通过内部不一致放大实现零样本LLM jailbreak检测

Xiao Lin, Philip Li, Zhichen Zeng, Tingwei Li, Tianxin Wei, Xuying Ning, Gaotang Li, Yuzhong Chen, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Visa

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 ALERT通过内部不一致放大技术实现零样本LLM jailbreak检测,有效提升安全检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03288 2026-01-08 cs.CR cs.CL 85%

How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference

你的 jailbreak 真的可信吗?基于锚定参考的细粒度 jailbreak 评估

Songyang Liu, Chaozhuo Li, Rui Pu, Litian Zhang, Chenxu Wang, Zejian Chen, Yuting Zhang, Yiming Hei

机构 * Key Laboratory of Trustworthy Distributed Computing(可信分布式计算重点实验室) Service Beijing University of Posts(北京邮电大学) Artificial Intelligence Research Institute China Academy of Information(人工智能研究所信息与通信技术 academy)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出 FJAR 框架,通过细粒度分类和锚定参考方法,评估 jailbreak 攻击的真实性和失败原因,提升攻击策略改进的指导性。

Comments 7 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 80%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR 70%

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03420 2026-01-08 cs.LG cs.AI cs.CR 62%

Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks

无需梯度或先验知识的LLM劫持:有效且可转移的攻击

Zhakshylyk Nurlanov, Frank R. Schmidt, Florian Bernard

机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) Bosch Center for Artificial Intelligence(博世人工智能中心) University of Bonn(波恩大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 57%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01211 2026-01-08 cs.CR cs.AI cs.MA 57%

Web Fraud Attacks Against LLM-Driven Multi-Agent Systems

针对基于大语言模型的多智能体系统 的网络欺诈攻击

Dezhang Kong, Hujin Peng, Yilun Zhang, Lele Zhao, Zhenhua Xu, Shi Lin, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Changsha University of Science and Technology(长沙理工大学) Purdue University(普渡大学) University of California San Diego(加州大学圣地亚哥分校) Zhejiang Gongshang University(浙江工商大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种针对基于大语言模型的多智能体系统的新攻击类型,通过网络链接的独特结构欺骗系统,展示了其在不同架构中的破坏潜力及逃避优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏