arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-24 至 2025-09-24 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2509.18058 2025-09-24 cs.LG cs.AI cs.CR 91%

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

Alexander Panfilov, Evgenii Kortukov, Kristina Nikolić, Matthias Bethge, Sebastian Lapuschkin, Wojciech Samek, Ameya Prabhu, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen & MPI for Intelligent Systems(图宾根ELLIS研究所与智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Fraunhofer HHI(弗劳恩霍夫高精尖研究所) ETH Zurich & ETH AI Center(苏黎世联邦理工学院与苏黎世人工智能中心) University of Tübingen(图宾根大学) TU Dublin(都柏林技术大学) TU Berlin & BIFOLD(柏林技术大学与BIFOLD)

专题命中 越狱攻击 :safety(title,abstract);AI safety(title);alignment(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13329 2025-09-24 cs.CL cs.AI cs.LG 67%

Language Models Can Predict Their Own Behavior

Dhananjay Ashok, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) University of Southern California(南加州大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented at the Thirty-Ninth Annual Conference on Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19100 2025-09-24 cs.LG cs.AI 62%

Algorithms for Adversarially Robust Deep Learning

Alexander Robey

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17371 2025-09-24 cs.CR cs.LG 57%

SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models

Haotian Xu, Qingsong Peng, Jie Shi, Huadi Zheng, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏