arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-11 至 2025-11-11 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2511.06512 2025-11-11 cs.CR cs.LG 89%

EASE: Practical and Efficient Safety Alignment for Small Language Models

Haonan Shi, Guoli Wang, Tu Ouyang, An Wang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01599 2025-11-11 cs.CL cs.CR cs.CV cs.LG 73%

JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models

Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学) Boise State University(博伊西州立大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06212 2025-11-11 cs.CR cs.AI 57%

RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework

Seif Ikbarieh, Kshitiz Aryal, Maanak Gupta

机构 * Department of Computer Science(计算机科学系) Tennessee Tech University(田纳西科技大学) School of Interdisciplinary Informatics(跨学科信息学学院) University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07315 2025-11-11 cs.CR 50%

JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework

Yuxuan Zhou, Yang Bai, Kuofeng Gao, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏