arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI智能体被判失败的案例中,15.3%可能判错了

arXiv 2607.28367 cs.AI

研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。

这项研究由佐治亚理工学院、北卡罗来纳州立大学、联想AI技术中心、北卡罗来纳大学教堂山分校、马凯特大学和复旦大学共同完成。审计覆盖网页操作、企业工作流和桌面控制,不涉及医疗、工业设计等专业智能体。

正确答案换一种路径,脚本就可能不认

电脑操作智能体的分数来自一条评测流水线:先写任务,再记录操作轨迹,随后由脚本或模型判断是否完成,最后汇总成成功率。其中任何一层出现问题,最终的失败标签都可能失真。

电脑操作智能体基准的四阶段测量流程

论文图1:任务构造、执行环境、评分和报告四个阶段都可能让最终分数失真。

WebArena的一条任务要求列出榜单中的五本单册图书。智能体给出了正确结果,但答案匹配程序没有接受这种表达方式。OSWorld中的状态检查器也会漏掉通过不同操作路径完成的有效结果。150条轨迹里,有16条属于这种评测器假阴性。

另有7条任务在审计时已无法正常完成。AssistantBench的开放网页任务会碰到失效搜索服务和验证码;OSWorld有一条电池电量任务,但公开虚拟机里根本没有对应的电源状态目录。此时失败反映的是环境变化,不是智能体能力。

论文对错误判定比例和典型案例的说明

论文第5页截图:WebArena漏掉有效答案,AssistantBench遇到验证码,OSWorld包含无法完成的电池任务。

不同基准的可靠性差异明显。研究抽查的24条WorkArena失败轨迹中,没有发现错误判定;WebArena抽查样本的评测器假阴性比例达到21.7%;AssistantBench则有21.7%的样本属于损坏任务。

五套基准的失败判定复核结果与真实失败分类

论文表2截图:150条失败轨迹中,16条为评测器假阴性,7条来自损坏任务;真实失败以反馈和规划问题为主。

真失败里,反复做无效动作比点错位置更常见

剔除错判、坏任务和证据不足的案例后,团队得到122条真实失败轨迹。最大的一类问题来自模型忽略反馈,视觉定位或按钮点击并非主因。

验证与反馈问题占39.3%。其中“无效操作重复”单项就占29.5%:模型执行动作后没有检查页面是否变化,随后继续重复同一步。规划问题占35.2%,包括违反任务要求、陷入循环和虚构软件功能。执行参数、定位和状态保存等底层错误占13.9%。

这组分类说明,单一成功率很难指导改进。失败如果来自规划循环,需要调整决策和记忆;如果来自评测器拒绝替代路径,继续训练模型不会解决问题;如果任务已经失效,分数甚至不应计入比较。

截图缺失会让复核结果继续变差

两种具备视觉能力的大模型先独立标注全部轨迹,再由两组人工审查者复核有争议的案例。两个模型对“是否判错”的原始一致率为92.7%,但对具体失败原因的判断只达到中等一致程度。

当审计人员拿不到截图时,两个模型分别有12条和13条结论发生变化,识别出的评测器假阴性数量也明显减少。页面最终状态、弹窗和视觉反馈如果没有保存在轨迹里,后续很难判断智能体到底做没做成。

15.3%不能改写为“所有智能体基准都有15.3%的分数错误”。样本只包含五套基准中公开的失败轨迹,共150条;研究没有抽查被判成功的记录,也没有覆盖其他领域。该比例的95%置信区间为10.4%到22.0%,人工与模型标注者给出的错判率也存在差异。

这项审计更适合改变分数的使用方式。模型排名出现几个百分点差距时,应先确认任务是否仍可执行、检查器是否接受等价解法,以及轨迹是否保留完整视觉证据。没有这些信息,一次版本升级带来的“提升”可能来自模型,也可能来自评分管线。

参考资料

https://arxiv.org/abs/2607.28367