Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu
机构
*
Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学)
;
IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学)
;
Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR))
;
Shanghai Jiao Tong University(上海交通大学)
;
ByteDance(字节跳动)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI
Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
通过约束策略优化实现检测器规避的LLM释义
Mingyi Wang, Zhuoer Shen, Yuheng Bu, Shaofeng Zou
机构
*
School of ECEE, Arizona State University(亚利桑那州立大学电子工程与计算机科学学院)
;
Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系)
Optimizing Diversity and Quality through Base-Aligned Model Collaboration
通过基座对齐模型协作优化多样性与质量
Yichen Wang, Chenghao Yang, Tenghao Huang, Muhao Chen, Jonathan May, Mina Lee
机构
*
University of Chicago(芝加哥大学)
;
University of Southern California, Information Sciences Institute(南加州大学信息科学研究所)
;
University of California, Davis(加州大学戴维斯分校)
专题命中
后训练与偏好优化
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)