She had Cobalt Blue Eyes: Prompt Testing to Create Aligned and Sustainable Language Models
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted as Oral at the AAAI 2nd Workshop on Sustainable AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted as Oral at the AAAI 2nd Workshop on Sustainable AI
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY、cs.LG
Comments 10 pages + references, 1 figure, accepted at NeurIPS 2023 Workshop on Regulatable ML as oral presentation
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG
Comments 35 pages, 18 figures, 32 tables. This work is an extended version of our paper (arXiv:2310.04955). Code will be released at https://github.com/jiazhi412/strong_attribute_bias
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY
Comments Presented at NeurIPS 2023 Moral Pyschology and Moral Philosophy workshop
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments 8 pages, 4 figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
Comments 15 pages
Journal ref International Journal on Cybernetics & Informatics (IJCI) Vol.12, No.6, December 2023
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
Comments 21 pages, 1 figure
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
Comments 7 pages, 1 table
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
Comments This paper has been accepted for publication and is forthcoming in The Global and Digital Governance Handbook. Cite as: Choung, H., David, P., & Seberger, J.S. (2023). A multilevel framework for AI governance. The Global and Digital Governance Handbook. Routledge, Taylor & Francis Group
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY
Comments 10 pages
Journal ref 2023 ACM Conference on Fairness, Accountability, and Transparency
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 22 pages, 8 figures
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
Comments under review
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
Comments Accepted to EMNLP 2022. Code and models are publicly available at https://github.com/princeton-nlp/mabel
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
Comments Presented as a (non-archival) poster at the 2022 ACM Conference on Equity and Access in Algorithms, Mechanisms, and Optimization or (EAAMO '22)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
Comments 2nd International Workshop on Industrial Machine Learning @ ICPR 2022
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
Comments 56th Hawaii International Conference on System Sciences (HICSS)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
Comments 16 pages, 1 table
Journal ref Computer Law Review International (2021), 22(4) 97-112