reward-lens: A Mechanistic Interpretability Library for Reward Models
reward-lens: 一个用于奖励模型的机制可解释性库
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 reward-lens库将传统生成LLM的机制可解释性工具适配至奖励模型,通过奖励头权重向量作为核心分析轴,提供多种分析工具和扩展功能,验证发现线性归因与因果修补效果存在负相关。
Comments 30 pages, 5 figures, 9 tables, including appendix. Library available at https://github.com/suhailnadaf509/reward-lens (pip install reward-lens)