arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2512.16307 2025-12-19 cs.CR cs.AI 79%

Beyond the Benchmark: Innovative Defenses Against Prompt Injection Attacks

超越基准:对抗提示注入攻击的创新防御

Safwan Shaheer, G. M. Refatul Islam, Mohammad Rafid Hamid, Tahsin Zaman Jilan

机构 * Dept. of CS, SDS BRAC University(计算机科学系,BRAC大学) Dept. of CSE, SDS BRAC University(计算机工程系,BRAC大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出创新防御机制,通过迭代优化防御提示,有效缓解LLM中的目标劫持漏洞,提升小型开源模型的安全性与部署效率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01228 2025-12-19 cs.CL cs.LG 62%

Who is In Charge? Dissecting Role Conflicts in Instruction Following

谁在掌控?解析指令遵循中的角色冲突

Siqi Zeng

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型在指令遵循中存在角色冲突,通过机制分析发现系统-用户冲突与社会冲突的不同处理方式,并强调了对齐方法的重要性。

Comments 12 pages, 5 figures, Mech Interp Workshop (NeurIPS 2025) Poster

详情

展开后加载摘要…

URL PDF HTML 收藏