arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

把AI扔进真实办公室,证据找到率从90.4%跌到74.5%

作者:arXivDaily编辑部 arXiv 2609.23806 cs · cs.AI

论文导读

哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学提出WorkWorlds:先固定员工真正能访问的完整组织状态,再把任务交给智能体。192组匹配评估中,完整工作环境让证据访问率从90.4%降到74.5%,主要差距发生在执行前的找资料阶段。

传统办公评测,可能提前替AI找好了资料

很多基准先定义任务,再挑选完成任务所需的文件、表格和邮件。智能体拿到的是一份围绕问题整理过的资料包,虽然仍要推理和操作,却省掉了真实工作中最费时间的一步:从整个岗位可见空间定位相关证据。

WorkWorlds反过来构建环境。一个“世界”先固定组织版本、日期和员工席位,生成该员工能访问的全部状态;任务稍后才加入。这样,环境不会因为已知题目而泄露哪些资料更重要,同一任务也能在完整岗位信息和人工精选资料两种条件下匹配比较。

图:同一组织世界和员工席位分别产生完整岗位信息与任务精选信息,再交给相同智能体评分。

192组匹配实验,把差距定位到证据访问

主实验使用一家合成制药公司,设计8项可测任务和6个员工岗位,共进行192组匹配评估。每组保持世界、任务、席位、智能体和计算预算相同,只改变智能体看到完整岗位资料,还是领域人员为任务挑出的子集。

完整环境中,证据访问率从90.4%降到74.5%;标准通过率从79.4%降到68.2%。一旦智能体已经访问到足够证据,后续通过率几乎没有变化。结果把主要损失指向信息定位,而不是拿到证据后的推理与写作。

图:完整岗位信息和任务精选子集条件下,864项评分标准的证据访问与通过状态分布。

同一资料包也会受整理者选择影响

研究设置两位领域整理者独立挑选任务资料,并做分层审计。两人的资料包并不完全相同,但在相同条件下证据访问率接近89.2%和90.0%。这说明“给哪些资料”本身就是评测设计决定,而不是中性的输入准备。

论文还记录智能体检查了哪些文件、调用哪些工具,以及首次找到足够证据的位置。评测因此可以区分三类失败:没有找到文件、找到后没有抽取关键证据、已经有证据却没满足交付标准。只看最终任务分数会把这些原因混在一起。

图:两位资料整理者构建的任务子集在证据访问、标准通过和敏感性分析上的对照结果。

下一步让企业评测先定义员工能看到什么

WorkWorlds目前主要依赖合成组织,任务数量也只有8项。扩展到真实企业前,还要处理权限、隐私、版本变化和不可公开数据。它给出的操作原则已经很明确:先固定岗位与组织状态,再出题;同时报告证据访问和任务完成,才能知道智能体究竟不会做,还是根本没找到材料。

参考资料

https://arxiv.org/abs/2609.23806

https://arxiv.org/html/2609.23806