Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability
大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示
机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) ; MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) ; Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) ; AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。
Journal ref 4th Deployable AI Workshop at AAAI 2026