arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-27 至 2025-10-27 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2406.16258 2025-10-27 cs.RO cs.AI cs.LG 81%

MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention

Yuxin Chen, Chen Tang, Jianglan Wei, Chenran Li, Ran Tian, Xiang Zhang, Wei Zhan, Peter Stone, Masayoshi Tomizuka

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21254 2025-10-27 cs.AI 79%

Out-of-Distribution Detection for Safety Assurance of AI and Autonomous Systems

Victoria J. Hodge, Colin Paterson, Ibrahim Habli

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07736 2025-10-27 cs.AI 77%

RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards

Jingnan Zheng, Xiangtian Ji, Yijun Lu, Chenhang Cui, Weixiang Zhao, Gelei Deng, Zhenkai Liang, An Zhang, Tat-Seng Chua

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10226 2025-10-27 cs.CV cs.AI cs.LG 62%

ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition

Parsa Rahimi, Sebastien Marcel

机构 * EPFL(苏黎世联邦理工学院) Idiap(日内瓦智能感知研究院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Extended version of ICMLw25 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12733 2025-10-27 cs.RO cs.AI cs.LG 62%

HYPE: Hybrid Planning with Ego Proposal-Conditioned Predictions

Hang Yu, Julian Jordan, Julian Schmidt, Silvan Lindner, Alessandro Canevaro, Wilhelm Stork

机构 * Mercedes-Benz AG, Research & Development(梅赛德斯-奔驰集团,研发部) Karlsruhe Institute of Technology, ITIV(卡尔斯鲁厄理工学院,ITIV) University of Tübingen(图宾根大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏