Evaluating and Improving LLM Self-Modeling
评估与改进大语言模型(LLM)的自我建模能力
机构 * Constellation(星群公司) ; Anthropic(Anthropic公司)
AI总结 本研究针对LLM的自我建模能力,构建基准测试评估其水平,开发合成数据管道结合强化学习提升该能力,发现提升未体现一致内省。
Comments 89 pages, 25 figures. Published as a conference paper at EMNLP '26 (Main)