微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。
在731个SWE-Bench Pro软件修复任务上,Argus报告约78%的准确率,Direct Copilot约59%;前者总Token用量是后者的1.41倍。成熟阶段相较启动阶段,每个任务的求解输入Token减少21%,活跃工作时间减少15%。
论文图1:Manager、Planner、Engineer和Reviewer围绕同一持久工作区执行任务,周围卡片分别展示七类原生指标。
四个角色共享一份可审查状态
Manager保存用户意图、权限边界和阶段目标;Planner把长期目标拆成有界任务;Engineer调用工具并产出代码或研究材料;Reviewer决定结果能否进入持久状态。记忆、技能、流程和被否决路线都要经过所属角色审查,能用任务原生验证器时还要先通过验证。
论文图2:任务失败可以触发修改、回滚或目标调整,而已验证成果继续保留在后续阶段。
这套设计针对两种相反错误:证据支持当前路线时过早放弃,或测量已经显示目标错误时仍继续消耗预算。Argus把稳定用户意图与可调整的操作目标分开,遇到矛盾可以修改计划,但不能擅自扩大权限。
审查带来恢复,也增加成本
软件修复任务中,466个任务调用独立Reviewer,265个由Engineer自审。走独立审查路线的任务消耗2.75倍求解输入Token和1.80倍活跃时间;Reviewer提出修改后,官方验证器恢复率为79.1%,严格审查循环挽救率为51.2%。
论文图3:更难的任务更常被路由到独立Reviewer,额外成本对应一部分验证恢复。
论文还报告GPU内核、语言模型训练、数学研究和论文流水线等结果。一个RWKV6优化内核被上游项目合并,六条论文流水线共完成254个任务并发生16次阶段回滚。这些案例展示了状态保留,但各自使用不同评价单位。
论文结果图:各评测保留任务原生量纲,不能把不同条形长度合并成一个总分。
七项结果不能压成一个排行榜
SWE-Bench、GPU内核、数学数据合成和论文生产的指标并不等价,图中的条形也采用独立刻度。约78%的软件修复成绩使用GPT-5.5骨干和特定Copilot后端,不能单独归因于运行时,也没有与所有现有代理在统一预算下比较。
用户如何引导目标调整尚缺公开前瞻实验,持久状态也不能消除错误目标或遗漏的隐含要求。Argus展示的是一套验证门控的运行方式;它是否在普通团队、不同模型和真实权限环境中持续节省成本,还需要独立复现。