arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-08 至 2025-10-08 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2507.12428 2025-10-08 cs.CL cs.AI cs.LG 85%

Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models

Yik Siu Chan, Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05865 2025-10-08 cs.AI cs.CV cs.RO 79%

The Safety Challenge of World Models for Embodied AI Agents: A Review

Lorenzo Baraldi, Zifan Zeng, Chongzhe Zhang, Aradhana Nayak, Hongbo Zhu, Feng Liu, Qunli Zhang, Peng Wang, Shiming Liu, Zheng Hu, Angelo Cangelosi, Lorenzo Baraldi

机构 * University of Pisa(比萨大学) Huawei RAMS Lab(华为RAMS实验室) Technical University of Munich(慕尼黑技术大学) Technical University of Berlin(柏林技术大学) University of Manchester(曼彻斯特大学) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05156 2025-10-08 cs.SE cs.AI cs.CR 79%

VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation

Lesly Miculicich, Mihir Parmar, Hamid Palangi, Krishnamurthy Dj Dvijotham, Mirko Montanari, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19823 2025-10-08 cs.LG cs.AI 79%

Persona Features Control Emergent Misalignment

Miles Wang, Tom Dupré la Tour, Olivia Watkins, Alex Makelov, Ryan A. Chi, Samuel Miserendino, Jeffrey Wang, Achyuta Rajaram, Johannes Heidecke, Tejal Patwardhan, Dan Mossing

机构 * OpenAI

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19056 2025-10-08 cs.CL cs.AI cs.LG 75%

An Embarrassingly Simple Defense Against LLM Abliteration Attacks

Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, Bernard Ghanem, George Turkiyyah

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint - under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16366 2025-10-08 cs.CL cs.AI cs.CR cs.LG 75%

A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens

David Dobre, Mehrnaz Mofakhami, Sophie Xhonneux, Leo Schwinn, Gauthier Gidel

机构 * Université de Montréal(蒙特利尔大学) Mila(Mila研究所) Technical University of Munich(慕尼黑技术大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全训练 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05194 2025-10-08 q-bio.QM 67%

Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria

Anni Tziakouri, Filippo Menolascina

专题命中 安全训练 :alignment(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05169 2025-10-08 cs.CR cs.AI 57%

From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs

Guangyu Shen, Siyuan Cheng, Xiangzhe Xu, Yuan Zhou, Hanxi Guo, Zhuo Zhang, Xiangyu Zhang

机构 * Purdue University(普渡大学) Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏