Democracy-in-Silico: Institutional Design as Alignment in AI-Governed Polities
机构 * Cyrion Labs(Cyron实验室)
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Cyrion Labs(Cyron实验室)
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI
机构 * IvI \& ILLC, University of Amsterdam
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI、cs.LG
Comments Accepted to the 28th European Conference on Artificial Intelligence (ECAI 2025) --- 21 pages, 15 figures, Earlier title: "Analyzing Probabilistic Logic Driven Safety in Multi-Agent Reinforcement Learning"; (changed for specificity and clarity)
机构 * Centre for Credible AI, Warsaw University of Technology, University of Warsaw(可信AI研究中心,华沙技术大学,华沙大学) ; Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute, Technical University of Berlin, Germany BIFOLD - Berlin Institute for the Foundations of Learning(人工智能系,弗劳恩霍夫 Heinrich Hertz 研究所,柏林技术大学,德国 BIFOLD - 柏林学习与数据基础研究所)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments 8 pages
Journal ref Frontiers in AI track at European Conference on Artificial Intelligence (ECAI) 2025
专题命中 安全训练 :safety(abstract);分类 cs.AI