arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2601.10173 2026-01-16 cs.CR cs.AI cs.CL 92%

ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack

ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击

Hao Li, Yankai Yang, G. Edward Suh, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :alignment(title,abstract);safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10338 2026-01-16 cs.CR cs.AI cs.CL cs.SE 62%

Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

真实世界中的智能体技能:大规模安全漏洞实证研究

Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang

机构 * Tianjin University(天津大学) Southern Cross University(南方十字大学) School of Cybersecurity, Tianjin University(安全学院,天津大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了智能体技能中普遍存在的安全漏洞,提出了一种多阶段检测框架,并展示了技能捆绑执行脚本与漏洞之间的显著关联。

详情

展开后加载摘要…

URL PDF HTML 收藏