arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2511.06852 2025-11-25 cs.CR cs.AI cs.LG cs.SE 88%

Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment

差异化方向干预:一种规避LLM安全对齐的框架

Peng Zhang, Peijie Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DBDI框架,通过区分有害检测和拒绝执行方向,提升LLM安全对齐的规避效果。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15289 2025-11-25 cs.CR cs.AI cs.CL 86%

SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage

SATA: 一种通过简单辅助任务链接实现LLM劫持的范式

Xiaoning Dong, Wenbo Hu, Wei Xu, Tianxing He

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Hefei University of Technology(合肥工业大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SATA通过简单辅助任务链接实现LLM劫持,有效绕过安全措施并提升攻击成功率

Comments ACL Findings 2025. Welcome to employ SATA as a baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 83%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17666 2025-11-25 cs.CR cs.AI 70%

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

评估现代大语言模型中的对抗漏洞

Tom Perel

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文评估了现代大语言模型在对抗攻击中的安全漏洞,通过比较Gemini 2.5 Flash和GPT-4的易受性,揭示了安全机制的差异及Transformer架构的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏