arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2508.09201 2026-08-27 cs.CR cs.AI cs.CV 版本更新 85%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 17 pages; Previously this version appeared as arXiv:2510.15430 (https://arxiv.org/abs/2510.15430) which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26008 2026-08-27 cs.CR cs.CL 新提交 83%

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

一种针对LLM越狱攻击的自进化多智能体框架防御方法

Tongyan Hu, Bryan Hooi

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 该研究针对LLM越狱攻击提出一种基于规则记忆的自进化多智能体防御框架,无需参数更新,可降低攻击成功率且保留良性效用,适用于两类LLM模型。

Comments 8 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20991 2026-08-27 cs.LG 版本更新 79%

Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models

对齐攻击:针对图基础模型的隐蔽后门攻击

Minhua Lin, Zhicheng Gao, Yilong Wang, Hanqing Lu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对带文本属性图的图基础模型,提出STAG隐蔽特洛伊木马攻击框架,协调图触发器生成器与文本软提示实现后门攻击,经多数据集实验验证其有效性与隐蔽性。

Comments Accepted by ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 75%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 50%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 越狱攻击 :alignment(abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25697 2026-08-27 cs.CR 新提交 50%

LMSM: LLM Security Framework Inspired by Linux Security Modules

LMSM:受Linux安全模块启发的大语言模型安全框架

XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究提出受Linux安全模块启发的LMSM框架,通过分离调解与策略实现LLM安全,在Qwen3-4B上可降低攻击成功率,同时保持较高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏