arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-05 至 2026-01-05 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2511.13788 2026-01-05 cs.LG cs.AI cs.CL cs.CR cs.MA 90%

Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments

对抗对齐中的扩展模式:来自多LLM jailbreak实验的证据

Samuel Nathanson, Rebecca Williams, Cynthia Matuszek

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过多LLM jailbreak实验揭示了模型大小不对称对对抗鲁棒性的影响,发现攻击者规模与有害输出严重性呈正相关,且攻击者对齐性可缓解有害响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 89%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07167 2026-01-05 cs.CR cs.CL 85%

One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models

一个触发标记就足够:一种在大型语言模型中平衡安全性和可用性的防御策略

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究提出D-STT算法,通过识别和解码安全触发标记,有效提升大型语言模型的安全性,同时保持其可用性与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏