arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-04 至 2025-09-04 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 1 篇

2509.02650 2025-09-04 cs.AI cs.GT q-bio.PE 70%

Can Media Act as a Soft Regulator of Safe AI Development? A Game Theoretical Analysis

Henrique Correia da Fonseca, António Fernandes, Zhao Song, Theodor Cimpeanu, Nataliya Balabanova, Adeela Bashir, Paolo Bova, Alessio Buscemi, Alessandro Di Stefano, Manh Hong Duong, Elias Fernandez Domingos, Ndidi Bianca Ogbo, Simon T. Powers, Daniele Proverbio, Zia Ush Shamszaman, Fernando P. Santos, The Anh Han, Marcus Krellner

机构 * INESC-ID and Instituto Superior Técnico, Universidade de Lisboa(INESC-ID和里斯本大学理工学院) School of Computing, Engineering and Digital Technologies, Teesside University(计算、工程与数字技术学院,泰赛德大学) Biological and Environmental Sciences, University of Stirling(生物与环境科学,斯特林大学) School of Mathematics, University of Birmingham(数学学院,伯明翰大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Machine Learning Group, Université libre de Bruxelles(机器学习小组,布鲁塞尔自由大学) AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) Division of Computing Science and Mathematics, University of Stirling(计算科学与数学系,斯特林大学) Department of Industrial Engineering, University of Trento(工业工程系,特伦特大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 10 Pages, 7 Figures, accepted in the ALIFE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏