arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-03 至 2026-03-03 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 11 篇

2510.21910 2026-03-03 cs.LG 85%

Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks

对抗性 déjà vu:用于更强泛化到未见攻击的 jailbreak 字典学习

Mahavir Dabas, Tran Huynh, Nikhil Reddy Billa, Jiachen T. Wang, Peng Gao, Charith Peris, Yao Ma, Rahul Gupta, Ming Jin, Prateek Mittal, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Princeton University(普林斯顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出通过对抗性技能组合训练提升模型对未知攻击的鲁棒性,通过分析攻击论文发现新型攻击是旧技能的重新组合,从而改进安全防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01784 2026-03-03 cs.CR cs.AI 85%

Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution

基于结构对抗进化的多模态对齐

Guoxin Shi, Haoyu Wang, Zaihui Yang, Yuxing Wang, Yongzhe Chang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出CEMA框架,通过共进化对抗提升多模态对齐的鲁棒性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 85%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01291 2026-03-03 cs.LG cs.CL 84%

JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks

JailNewsBench: 多语言和区域假新闻生成对抗基准

Masahiro Kaneko, Ayana Niwa, Timothy Baldwin

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 JailNewsBench 是首个评估大语言模型对抗jailbreak攻击生成假新闻鲁棒性的多语言和区域基准,揭示了不同语言和区域间安全性的不平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 79%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00565 2026-03-03 cs.CV cs.AI cs.CR 70%

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型

Yilian Liu, Xiaojun Jia, Guoshun Nan, Jiuyang Lyu, Zhican Chen, Tao Guan, Shuyuan Luo, Zhongyi Zhai, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。

Journal ref The Fourteenth International Conference on Learning Representations(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17132 2026-03-03 cs.CV cs.CL 70%

Dynamic Token Reweighting for Robust Vision-Language Models

动态令牌重加权用于鲁棒的视觉-语言模型

Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 DTR通过优化KV缓存动态调整视觉令牌权重,提升视觉-语言模型对多模态劫持攻击的鲁棒性,同时保持模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09462 2026-03-03 cs.LG cs.AI cs.CR 62%

Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols

对可信监控的自适应攻击颠覆AI控制协议

Mikhail Terekhov, Alexander Panfilov, Daniil Dzenhaliou, Caglar Gulcehre, Maksym Andriushchenko, Ameya Prabhu, Jonas Geiping

机构 * MATS EPFL(瑞士联邦理工学院) ELLIS Institute Tübingen & Max Planck Institute for Intelligent Systems(图宾根ELLIS研究所及图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出针对AI控制协议中监控模型的自适应攻击方法,通过嵌入提示注入技术规避监控并完成恶意任务,揭示了当前控制协议的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01574 2026-03-03 cs.CR cs.AI 57%

DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern

DualSentinel: 一种用于通过双熵低谷模式检测黑盒LLM中针对性攻击的轻量级框架

Xiaoyi Pang, Xuanyi Hao, Pengyu Liu, Qi Luo, Song Guo, Zhibo Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) School of Cyber Science and Technology(网络安全科学与技术学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 DualSentinel通过双熵低谷模式检测黑盒LLM中的针对性攻击,提供高效且准确的防御方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI 57%

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00131 2026-03-03 cs.MA cs.AI 57%

Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems

Thought Virus: 通过潜意识提示在多智能体系统中产生病毒性偏差

Moritz Weckbecker, Jonas Müller, Ben Hagag, Michael Mulet

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本研究揭示了多智能体系统中通过潜意识提示传播偏见的风险,指出单个智能体的潜意识提示可能影响整个网络的诚实性,提出新的安全攻击向量。

Comments 18 pages, 10 figures, 2 tables. Code available at https://github.com/Multi-Agent-Security-Initiative/thought_virus

详情

展开后加载摘要…

URL PDF HTML 收藏