Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
机构 * Columbia University(哥伦比亚大学) ; Barnard College(巴纳德学院)
专题命中 幻觉与事实性 :alignment(title);safety(abstract);分类 cs.CL、cs.LG
Comments ACL EMNLP 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Columbia University(哥伦比亚大学) ; Barnard College(巴纳德学院)
专题命中 幻觉与事实性 :alignment(title);safety(abstract);分类 cs.CL、cs.LG
Comments ACL EMNLP 2025
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Chinese Academy of Sciences(中国科学院) ; Shanghai AI Lab(上海人工智能实验室) ; Tencent Hunyuan(腾讯文英)
专题命中 幻觉与事实性 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments Working in progress
机构 * Sirraya Labs(Sirraya实验室)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Comments: 14 pages, 14 figures, 5 tables. Code available at: https://github.com/sirraya-tech/Sirraya_LSD_Code
机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
Comments Accepted to UncertaiNLP workshop of EMNLP 2025
机构 * University of Cambridge(剑桥大学) ; University of Kent(肯特大学) ; Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
Comments 6th ACM International Conference on AI in Finance
机构 * University of Oxford(牛津大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Accepted to EMNLP(main)2025
专题命中 幻觉与事实性 :safety(abstract)
Comments 17 pages