arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-07 至 2025-08-07 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2507.06043 2025-08-07 cs.CR cs.AI 83%

CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations

Xiaohu Li, Yunfeng Ning, Zepeng Bao, Mayi Xu, Jianhao Chen, Tieyun Qian

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI

Comments Accepted to ACL 2025 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04196 2025-08-07 cs.CL cs.AI cs.CR 62%

Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models

Siddhant Panpatil, Hiskias Dingeto, Haon Park

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏