Position: Require Frontier AI Labs To Release Small "Analog" Models
机构 * Frontier AI Labs(前沿人工智能实验室)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Frontier AI Labs(前沿人工智能实验室)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
机构 * Cornell University(康奈尔大学) ; Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 28 pages, 11 figures, 16 tables. In submission
机构 * Technical University of Munich(慕尼黑技术大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
Comments EMNLP 2025 (Oral)
机构 * Department of Computer Science University of Chicago(计算机科学系芝加哥大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 21 pages, 15 figures, 14 tables. Accepted as a conference paper at COLM 2025. Camera-ready
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Institute for Humanities-Centered AI (CHAI), University of Hamburg, Germany(人文中心人工智能研究所(CHAI),汉堡大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
Comments This paper is the extended version of a paper accepted at the European Conference on Artificial Intelligence 2025 (ECAI 2025), providing the proof of the main theorem in the appendix
机构 * Department of Computer Science(计算机科学系) ; National University of Singapore(新加坡国立大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
机构 * Department of CST Tsinghua University Beijing, China(计算机科学与技术系 清华大学 北京中国) ; Department of CSE Chandigarh University Mohali, India(计算机科学与工程系 印度昌迪加尔大学 摩哈利)
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI
机构 * University of Calabria, Rende, Italy(卡拉布里亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
Comments Accepted to the ACM Conference on Fairness, Accountability, and Transparency (FAccT '25)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments Published as a RAND commentary
Journal ref Santa Monica, CA: RAND Corporation, 2024. https://www.rand.org/pubs/perspectives/PEA3703-1.html
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
机构 * AI Disclosures Project, Social Science Research Council Institute for Innovation and Public Purpose, University College London(AI披露项目,社会科学理事会创新与公共目的研究所,伦敦大学学院) ; AI Disclosures Project, Social Science Research Council(AI披露项目,社会科学理事会) ; O’Reilly Media(O’Reilly媒体)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
Comments Corrected a previous error: replaced 'underrepresented in Academic AI research' with the intended phrase 'underrepresented in Corporate AI research'
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY
Comments 32 pages, 6 figures. Accepted for publication in the Journal of Engineering Education (2025)
机构 * Bloomberg(彭博社) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted to FAccT 2025
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments Working paper version (35 pages). Submitted to So. Ill. Law Journal; full-form citations retained for editorial review. Not peer-reviewed. Subject to revision
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
Comments 28 table, 7 Figures, 78 pages
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Journal ref 599(2024)128111
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 19 pages, 2 figures
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 34 pages, 9 tables, 1 figure
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY
Comments To appear at AIES 2024
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY
Comments Whitepaper - deliverable from the KI.NRW flagship-project "Zertifizierte KI"