Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?
Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?
机构 * OpenAI ; Anthropic ; Google DeepMind(谷歌DeepMind)
AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。