arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-28 至 2026-01-28 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2601.19487 2026-01-28 cs.LG cs.AI 88%

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

LLM-VA: 通过向量对齐解决对抗性回应与过度拒绝的权衡

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 LLM-VA通过向量对齐解决大型语言模型在对抗性回应与过度拒绝间的权衡问题,提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 85%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 73%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19375 2026-01-28 cs.LG cs.AI 62%

Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection

选择性引导:通过判别层选择实现的范数保持控制

Quy-Anh Dang, Chris Ngo

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 选择性引导通过判别层选择和范数保持旋转,实现对LLM行为的可控稳定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19051 2026-01-28 cs.CR 50%

Proactive Hardening of LLM Defenses with HASTE

通过HASTE主动增强LLM防御

Henry Chen, Victor Aranda, Samarth Keshari, Ryan Heartfield, Nicole Nichols

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 HASTE通过主动生成对抗样本提升LLM防御效果,有效降低基线检测器误报率并优化检测模型性能。

Comments Accepted at peer review NDSS 2026, Last-X workshop. Camera ready copy forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏