TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation
TempoBench:评估大语言模型中的时间因果推理
机构 * Columbia University(哥伦比亚大学) ; Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)
专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。