Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments Accepted by AIES 2025, camera-ready version
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments Accepted by AIES 2025, camera-ready version
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Journal ref PLoS One 20(10): e0332919, 2025
机构 * University of Southern California(南加州大学) ; University of Michigan(密歇根大学) ; Babson College(巴布森学院) ; University of Connecticut(康涅狄格大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Accepted by NeurIPS 2025
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
机构 * MBZ University of AI(MBZ人工智能大学) ; Hamad Bin Khalifa University(哈马德·本·卡西姆大学) ; Birmingham City University(伯明翰城市大学) ; Qatar University(卡塔尔大学) ; University Hospitals Birmingham and University of Birmingham(伯明翰大学医院和伯明翰大学)
专题命中 AI治理与伦理 :alignment(abstract)
专题命中 AI治理与伦理 :safety(abstract)