arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 86%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03356 2026-01-13 cs.CR 82%

From static to adaptive: immune memory-based jailbreak detection for large language models

从静态到适应性:基于免疫记忆的大型语言模型 jailbreak 检测

Jun Leng, Yu Liu, Litian Zhang, Ruihan Hu, Zhuting Fang, Xi Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 基于免疫记忆的框架,通过动态记忆更新和主动免疫机制,提升大型语言模型对 jailbreak 攻击的检测准确率至 94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 70%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06884 2026-01-13 cs.CL cs.AI cs.LG 67%

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

对LLM-as-a-Reviewer的改写对抗攻击

Masahiro Kaneko

机构 * MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06305 2026-01-13 cs.CL 57%

Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models

为何LoRA无法遗忘:针对语言模型中的后门行为的正则化低秩适应

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RoRA通过增强谱强度和纠正对齐,有效提升LoRA在对抗后门攻击时的遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏