Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu
机构
*
Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学)
;
IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学)
;
Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR))
;
Shanghai Jiao Tong University(上海交通大学)
;
ByteDance(字节跳动)
机构
*
School of Mathematical Sciences, Peking University(北京大学数学科学学院)
;
Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)
;
School of Computing and Data Science, the University of Hong Kong(香港大学计算科学与数据科学学院)
;
Bytedance Inc(字节跳动公司)
AI总结
提出 AdaGrad++ 和 Adam++ 两种简单无参数自适应梯度方法,在无需预设学习率的情况下实现与 AdaGrad 和 Adam 相当的收敛保证。