Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
测量多步语言模型智能体中工具诱导的信念差异
机构 * University of Toronto(多伦多大学) ; Emory University(埃默里大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。
Comments 28 pages