Verbalizable Representations Form a Global Workspace in Language Models
语言模型中的可言语化表征形成全局工作空间
机构 * Anthropic(A÷)
AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。
大厂专区
语言模型中的可言语化表征形成全局工作空间
机构 * Anthropic(A÷)
AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。