Mechanisms of Introspective Awareness
内省意识的机制
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; MIT(麻省理工学院) ; Constellation ; Anthropic
AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。
大厂专区
内省意识的机制
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; MIT(麻省理工学院) ; Constellation ; Anthropic
AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。