Reversing the Paradigm: Building AI-First Systems with Human Guidance
机构 * Minerva CQ
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Minerva CQ
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
机构 * KAIST AI(韩国科学技术院人工智能研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments 20 pages including references and appendix; To appear in ACL 2025 main conference
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
机构 * INRIA, LMO, Université Paris-Saclay, Orsay, France(INRIA、LMO、巴黎-萨克雷大学、欧萨斯分校、法国) ; TML Lab, EPFL, Switzerland(TML实验室、瑞士联邦理工学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
Comments ICML camera ready version
机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和 梵高大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
机构 * School of Information University of Texas at Austin(信息学院得克萨斯大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Journal ref CHI EA ' 2025: Proceedings of the Extended Abstracts of the CHI Conference on Human Factors in Computing Systems
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Journal ref ICML 2025
机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) ; AI Lab, China Mobile Communication Group Tianjin Co., Ltd.(中国移动通信集团天津有限公司人工智能实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments Accepted by ACL 2025
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
Comments 10 pages, 1 figure, 1 table, in review for AIES 2025, presented at TAIS 2025
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Comments Updated abstract to fix a typo; no changes to the content of the paper
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
机构 * HKUST(GZ)(香港科技大学(广州)) ; CSE, HKUST(香港科技大学计算机科学与工程系) ; Xi’an Jiaotong University(西安交通大学) ; University of Pisa, IT(比萨大学) ; University of Trento, IT(特伦特大学) ; Nagoya University(名古屋大学) ; China University of Mining & Technology, Beijing(中国矿业大学(北京)) ; Tongji University(同济大学) ; SPIC Energy Science and Technology Research Institute(SPIC能源科学与技术研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
机构 * University of Western Australia(西澳大学) ; University of Melbourne(墨尔本大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Australian National University(澳大利亚国立大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
Comments This research is supported by the NISDRG project #20100007, funded by the Australian Government
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
机构 * MPI-SWS(马克斯·普朗克所社会科学研究院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
Comments 24 pages, 3 figures, FAccT '25
机构 * University of Information Technology, VNU–HCM(越南胡志明市信息技术大学) ; University College Cork(科尔克大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments Accepted by AIED 2025: Late-Breaking Results (LBR) Track
机构 * Ruta Binkyte(独立研究者)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
Comments In: Justin Bullock, Baobao Zhang, Yu-Che Chen, Johannes Himmelreich, Matthew Young, Antonin Korinek & Valerie Hudson (eds.). Oxford Handbook on AI Governance (Oxford University Press, 2022 forthcoming)
机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Comments Accepted to Workshop EXTRAAMAS 2025 in AAMAS Conference
机构 * Sebastian Dumbrava(独立研究者)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
Comments 30 pages, 9 figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
机构 * Institute for Automation and Applied Informatics(自动化与应用信息研究所) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
机构 * School of Electrical Engineering & Computer Science, Washington State University(电气工程与计算机科学学院,华盛顿州立大学) ; Department of Mathematics and Statistics, Washington State University(数学与统计学系,华盛顿州立大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG
Comments AISTATS 2025