arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2602.04294 2026-02-05 cs.CL cs.AI cs.CR 86%

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13893 2026-02-05 cs.CL cs.AI 84%

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

守护护栏:一种基于分类的 Jailbreak 检测方法

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于分类的 Jailbreak 检测方法,通过构建分层分类体系,分析攻击类型,评估提示引导效果,并建立新的多轮对抗对话数据集,以提升对 Jailbreak 技术的检测能力。

Comments 2nd Conference on International Association for Safe & Ethical AI (IASEAI 2026), 24-26 February 2026, UNESCO House, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04196 2026-02-05 cs.CL cs.LG 84%

The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment

缺失的一半:揭示训练时间隐含的安全风险

Zhexin Zhang, Yida Lu, Junfeng Fang, Junxiao Yang, Shiyao Cui, Hao Zhou, Fandong Meng, Jie Zhou, Hongning Wang, Minlie Huang, Tat-Seng Chua

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话研究院) National University of Singapore(新加坡国立大学) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统研究训练期间隐式安全风险,揭示模型内部激励和上下文信息驱动的有害行为,并通过实验展示其广泛存在和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 57%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 57%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏