arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-01 至 2026-01-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2508.12897 2026-01-01 cs.AI cs.CR 89%

RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models

RAJ-PGA:基于推理激活和原则引导对齐的大型推理模型安全对齐框架

Jianhao Chen, Mayi Xu, Haoyang Chen, Xiaohu Li, Xiangyu Zhang, Jianjie Huang, Zheng Wang, Xiaochun Cao, Tieyun Qian

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络安全学院) School of Cybersecurity and Technology, Sun Yat-sen University(中山大学网络安全学院)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 RAJ-PGA框架通过推理激活和原则引导对齐方法,提升大型推理模型的安全性,减少有害推理链的影响,同时保持模型推理能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24044 2026-01-01 cs.CR cs.AI cs.CL 86%

Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?

对抗攻击与内容安全过滤:我们在LLM安全竞赛中走了多远?

Yuan Xin, Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Southern University of Science and Technology(南方科技大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文系统评估了针对LLM安全对齐的劫持攻击,发现大多数攻击可被安全过滤器检测到,同时指出需优化召回率和精确度以提升安全系统性能。

Comments 26 pages,11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08990 2026-01-01 cs.CR cs.AI cs.CL 73%

Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks

对黑盒大语言模型进行高效有效的跨行为攻击

Vasudev Gohil

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种高效的黑盒LLM劫持方法,通过跨行为攻击显著提高攻击效率和成功率,同时减少查询次数并展示良好的迁移能力。

Comments Code is at https://github.com/gohil-vasudev/JCB

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 50%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 越狱攻击 :alignment(abstract)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20290 2026-01-01 cs.CR 50%

APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training

APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎

Xuebo Qiu, Mingqi Lv, Yimei Zhang, Tieming Chen, Tiantian Zhu, Qijie Song, Shouling Ji

专题命中 越狱攻击 :alignment(abstract)

AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。

Comments Accepted by SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18536 2026-01-01 cs.IR 50%

Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges

相关性错觉:任意内容注入攻击欺骗检索器、重排序器和LLM判断者

Manveer Singh Tamber, Jimmy Lin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文揭示了任意内容注入攻击可欺骗检索器、重排序器和LLM判断者,指出模型在安全性和鲁棒性上的弱点,并呼吁进一步研究。

Comments AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏