When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents
当工具失效时:LLM智能体动态重规划与异常恢复的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Sochow University(苏州大学) ; Shandong University(山东大学) ; Baidu Inc.(百度公司)
AI总结 本文提出ToolMaze基准,通过有向无环图拓扑复杂度和工具扰动分类法,评估LLM智能体在工具失效时的动态重规划与错误恢复能力,发现模型对隐式语义故障的恢复率下降约37%,且智能体容错性随模型规模增长的速度远慢于基本任务执行。