arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

智能体跑得久还要会掉头:Argus修复任务约78%,代价是1.41倍Token

arXiv 2608.05144 cs.AI

微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。

在731个SWE-Bench Pro软件修复任务上,Argus报告约78%的准确率,Direct Copilot约59%;前者总Token用量是后者的1.41倍。成熟阶段相较启动阶段,每个任务的求解输入Token减少21%,活跃工作时间减少15%。

Argus角色、状态与七类评测总览

论文图1:Manager、Planner、Engineer和Reviewer围绕同一持久工作区执行任务,周围卡片分别展示七类原生指标。

四个角色共享一份可审查状态

Manager保存用户意图、权限边界和阶段目标;Planner把长期目标拆成有界任务;Engineer调用工具并产出代码或研究材料;Reviewer决定结果能否进入持久状态。记忆、技能、流程和被否决路线都要经过所属角色审查,能用任务原生验证器时还要先通过验证。

从重置式会话到持久自我进化

论文图2:任务失败可以触发修改、回滚或目标调整,而已验证成果继续保留在后续阶段。

这套设计针对两种相反错误:证据支持当前路线时过早放弃,或测量已经显示目标错误时仍继续消耗预算。Argus把稳定用户意图与可调整的操作目标分开,遇到矛盾可以修改计划,但不能擅自扩大权限。

审查带来恢复,也增加成本

软件修复任务中,466个任务调用独立Reviewer,265个由Engineer自审。走独立审查路线的任务消耗2.75倍求解输入Token和1.80倍活跃时间;Reviewer提出修改后,官方验证器恢复率为79.1%,严格审查循环挽救率为51.2%。

独立审查的路由与恢复效果

论文图3:更难的任务更常被路由到独立Reviewer,额外成本对应一部分验证恢复。

论文还报告GPU内核、语言模型训练、数学研究和论文流水线等结果。一个RWKV6优化内核被上游项目合并,六条论文流水线共完成254个任务并发生16次阶段回滚。这些案例展示了状态保留,但各自使用不同评价单位。

七类任务的原生指标对比

论文结果图:各评测保留任务原生量纲,不能把不同条形长度合并成一个总分。

七项结果不能压成一个排行榜

SWE-Bench、GPU内核、数学数据合成和论文生产的指标并不等价,图中的条形也采用独立刻度。约78%的软件修复成绩使用GPT-5.5骨干和特定Copilot后端,不能单独归因于运行时,也没有与所有现有代理在统一预算下比较。

用户如何引导目标调整尚缺公开前瞻实验,持久状态也不能消除错误目标或遗漏的隐含要求。Argus展示的是一套验证门控的运行方式;它是否在普通团队、不同模型和真实权限环境中持续节省成本,还需要独立复现。

参考资料

https://arxiv.org/abs/2608.05144