arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-14 至 2025-10-14 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2506.17368 2025-10-14 cs.LG cs.AI cs.CR 84%

SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification

Zhenglin Lai, Mengyao Liao, Bingzhe Wu, Dong Xu, Zebin Zhao, Zhihang Yuan, Chao Fan, Jianqiang Li

机构 * School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) ByteDance Inc(字节跳动公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10452 2025-10-14 cs.CL 83%

Steering Over-refusals Towards Safety in Retrieval Augmented Generation

Utsav Maskey, Mark Dras, Usman Naseem

机构 * Macquarie University(麦觉里大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10823 2025-10-14 cs.AI cs.NE cs.RO 79%

The Irrational Machine: Neurosis and the Limits of Algorithmic Safety

Daniel Howard

机构 * Howard Science Limited, Malvern, UK(霍华德科学有限公司,英国马尔文) QinetiQ Fellow, UK(QinetiQ Fellow,英国) Member of Senior Common Room, Pembroke College, University of Oxford(奥克斯福德大学彭伯里学院高级共同房间成员)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 41 pages, 17 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10390 2025-10-14 cs.CL cs.AI cs.LG 75%

RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models

Aashiq Muhamed, Leonardo F. R. Ribeiro, Markus Dreyer, Virginia Smith, Mona T. Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09781 2025-10-14 cs.LG cs.AI cs.CL 67%

Building a Foundational Guardrail for General Agentic Systems via Synthetic Data

Yue Huang, Hang Hua, Yujun Zhou, Pengcheng Jing, Manish Nagireddy, Inkit Padhi, Greta Dolcetti, Zhangchen Xu, Subhajit Chaudhury, Ambrish Rawat, Liubov Nedoshivina, Pin-Yu Chen, Prasanna Sattigeri, Xiangliang Zhang

机构 * University of Notre Dame(诺特大学) MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) University of Washington(华盛顿大学) Ca’ Foscari University of Venice(威尼斯卡福尔学院) IBM Research(IBM研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.15907 2025-10-14 cs.AI cs.LG 62%

Learning to Be Cautious

Montaser Mohammedalamen, Dustin Morrill, Alexander Sieusahai, Yash Satsangi, Michael Bowling

机构 * University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Published at the Transactions on Machine Learning Research Journal (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10633 2025-10-14 cs.AI 57%

Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion

Jiabao Shi, Minfeng Qi, Lefeng Zhang, Di Wang, Yingjie Zhao, Ziying Li, Yalong Xing, Ningran Li

机构 * Minzu University of China(民族大学) City University of Macau(澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) The University of Adelaide(阿德莱德大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11185 2025-10-14 cs.HC 50%

Principles of Safe AI Companions for Youth: Parent and Expert Perspectives

Yaman Yu, Mohi, Aishi Debroy, Xin Cao, Karen Rudolph, Yang Wang

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏