Language Models use Lookbacks to Track Beliefs
语言模型使用回溯来跟踪信念
机构 * Northeastern University(东北大学) ; Technion(技术学院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Goodfire ; Pr(Ai) 2 R Group(Pr(Ai) 2 R集团)
AI总结 本研究揭示语言模型通过回溯机制跟踪角色信念的算法模式,通过构建CausalToM数据集,分析LM在因果中介和抽象中的推理能力,并探讨可见性对信念更新的影响。
Comments 38 pages, 50 figures. Code and data at https://belief.baulab.info/