The Straight and Narrow: Do LLMs Possess an Internal Moral Path?
直行与狭窄:大型语言模型是否具有内在的道德路径?
机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) ; School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) ; Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。