Mechanistic Analysis of Alignment Algorithms in Language Models
语言模型中对齐算法的机制分析
机构 * University of Copenhagen(哥本哈根大学) ; Independent(独立研究者) ; IIT Jodhpur(印度理工学院焦特布尔分校) ; NIT Agartala(印度国立理工学院阿加尔塔拉分校) ; Narris
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。
Comments Work in Progress