arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-04 至 2026-03-04 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2603.03081 2026-03-04 cs.CL 85%

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

TAO-Attack:迈向大型语言模型的高级优化基 Jailbreak 攻击

Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

机构 * Dalian University of Technology(大连理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 TAO-Attack 提出了一种基于优化的 Jailbreak 攻击方法,通过双阶段损失函数和方向优先 token 优化策略,有效提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02479 2026-03-04 cs.CR cs.CL 77%

BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage

BitBypass:一种新的方向:利用位流伪装进行对齐大语言模型的黑盒劫持

Kalyan Nakka, Nitesh Saxena

机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯A&M大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 BitBypass通过位流伪装技术,提出了一种新的黑盒劫持方法,有效绕过对齐大语言模型的安全机制,展现出更高的隐蔽性和攻击成功率。

Comments 27 pages, 27 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08207 2026-03-04 cs.AI 57%

Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking

面向动态Stackelberg博弈框架的代理AI防御对抗大语言模型劫持

Zhengye Han, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出动态Stackelberg博弈框架,用于代理AI防御对抗大语言模型劫持,通过RRT搜索和博弈树分析提升防御效果。

Comments Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 越狱攻击 :harmlessness(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏