arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-07 至 2025-10-07 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2510.05025 2025-10-07 cs.CL cs.AI cs.CR 73%

Imperceptible Jailbreaking against Large Language Models

Kuofeng Gao, Yiming Li, Chao Du, Xin Wang, Xingjun Ma, Shu-Tao Xia, Tianyu Pang

机构 * Tsinghua University(清华大学) Sea AI Lab, Singapore(新加坡Sea AI实验室) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18564 2025-10-07 cs.CR cs.AI 70%

DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization

Xinzhe Huang, Kedong Xiu, Tianhang Zheng, Churui Zeng, Wangze Ni, Zhan Qin, Kui Ren, Chun Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(区块链与数据安全国家重点实验室,浙江大学,杭州,中国) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,中国)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21947 2025-10-07 cs.LG cs.AI 62%

Active Attacks: Red-teaming LLMs via Adaptive Environments

Taeyoung Yun, Pierre-Luc St-Charles, Jinkyoo Park, Yoshua Bengio, Minsu Kim

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) LawZero Omelet Université de Montréal(蒙特利尔大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 7 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23882 2025-10-07 cs.AI cs.CR 57%

Quant Fever, Reasoning Blackholes, Schrodinger's Compliance, and More: Probing GPT-OSS-20B

Shuyi Lin, Tian Lu, Zikai Wang, Bo Wen, Yibo Zhao, Cheng Tan

机构 * Northeastern University(东北大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏