Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA
LLM能否比生成更好地判断?探究上下文问答中的任务不对称性、机制可解释性与可迁移性
机构 * Adobe Research(Adobe研究院)
AI总结 本研究在受控上下文问答中测试LLM自我评估是否比生成更容易,发现评估并非普遍更易,注意力分析显示评估对上下文关注更少,微调实验证实不对称性非训练伪影,挑战了自我评估管线的核心假设。
Comments 18 pages