arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2605.04992 2026-08-28 cs.CR 版本更新 89%

You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation

你若懈怠,便会错失:通过神经权重转换自动恢复安全对齐

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera, Stjepan Picek, Saraga Sakthidharan

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)

AI总结 针对公共LoRA适配器安全对齐缺失或微调导致领域知识退化的问题,提出NeWTral方法,在参数空间内转换不安全适配器,可将平均攻击成功率从70%降至13%,保留88%知识保真度,无需原始训练数据和重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-28 cs.CV cs.MM 新提交 82%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26506 2026-08-28 cs.LG cs.CL 新提交 79%

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击

Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen

机构 * RIKEN AIP(理化学研究所先进智能项目) Institute of Science Tokyo(东京科学大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。

Comments Accepted by EMNLP findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23838 2026-08-28 cs.CR cs.AI cs.CL cs.LG 版本更新 67%

TriShieldRAG: 3 Rings, One Blind Spot in Layered Defenses for Retrieval-Augmented Generation

TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架

Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。

Comments v2: Adds an adaptive-attacker evaluation in which Ring 1 is fully evaded (500/500 documents, three corpora); scales to the full NQ, HotpotQA and MS-MARCO corpora; corrects Proposition 1, whose boundary is corpus-dependent (0.214/0.251/0.558) not 0.5; retracts a proposed closed form after a pre-registered prediction failed. The v1 headline 91%-to-13% result is withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 57%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏