Mechanistically Eliciting Latent Behaviors in Language Models
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
大厂专区
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
用于特征发现和长上下文归因的轮次平均稀疏自编码器
机构 * Anthropic Fellows Program(Anthropic 合作者计划) ; Anthropic
AI总结 提出轮次平均稀疏自编码器,通过重构轮次平均激活来固定特征数量,简化长上下文下的特征归因与解释。