arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达让Coding Agent少烧近一半Token,API成本再降三分之一

作者:arXivDaily编辑部 arXiv 2609.20519 cs · cs.AI

论文导读

英伟达、南洋理工大学和麻省理工学院团队提出SoL-Pi,让自动研究循环直接优化Coding Agent外层框架。在51项EdgeBench任务上,它与Pi表现相近,却把记录到的Token流量减少44.7%—49.0%,API成本约降三分之一,为全天运行的代码智能体压低持续开销。

模型没换,外层框架先动手省Token

Coding Agent并不是只把问题发给模型一次。它要读取仓库、执行命令、查看报错、修改文件,再根据新观察继续行动。任务越长,历史记录越多;如果每轮都把大量旧输出原样塞回上下文,成本会沿轨迹持续累积。

SoL-Pi优化的是模型外面的“harness”,也就是负责组织工具、上下文和观察的执行框架。团队让自动研究系统在多种任务环境中提出改动、跑对照实验并筛选可迁移方案,最终留下动作执行、上下文压缩、观察处理和委派阅读四类机制。

图1:项目页用多轮代码与红色轨迹表示框架改动在任务中被搜索和筛选。

四个改动都在减少无效往返

动作融合把可连续执行的工具操作放进一次模型回合,避免每个小动作都重新请求;上下文记忆把仍有用的状态保留下来,过期细节则压缩。ObservationPack对工具输出做结构化整理,委派阅读允许子任务只返回结论和必要证据。

这些机制不是按主观感觉保留。自动研究循环先在开发环境里反复比较,再用隔离任务验证是否仍有效。论文把这种流程称为递归扩展:环境越多,单次偶然优化越难蒙混过关,真正可复用的改动才会进入最终框架。

图2:论文方法图展示自动研究循环如何把框架候选送入任务评估并继续筛选。

下一步把节省带进真实大型仓库

EdgeBench覆盖51项任务。论文报告,在GPT-5.6 Sol和Opus 5上,SoL-Pi与Pi的任务表现大体相当,记录到的Token流量少44.7%—49.0%,API成本约低三分之一。按当时价格估算,相对原生Codex和Claude Code框架每小时节省8.75—13.50美元,相对Pi每小时节省4.36—5.71美元。

图3:项目页展示ObservationPack配置搜索、账单变化、响应成本与归一化任务分数。

这些金额受模型定价、缓存折扣、任务长度和工具输出规模影响,不能当作固定报价。论文更稳固的结论是:长轨迹智能体的成本不只由底层模型决定,外层框架怎样裁剪观察、何时合并动作,同样会改变Token流量。项目代码已经公开,下一步可在真实大型仓库、并发任务和不同供应商计费规则下复测,并重点观察压缩是否遗漏影响修复质量的日志与代码上下文。

工程团队还可按任务类型拆账:代码搜索、测试执行、日志读取和补丁验证消耗的Token结构并不相同。如果框架能指出每次压缩删除了什么、保留依据是什么,成本优化才容易被复核,也更适合持续集成环境中的无人值守任务。

参考资料

https://arxiv.org/abs/2609.20519

https://arxiv.org/html/2609.20519

https://nvlabs.github.io/SoL-Pi/

https://github.com/NVlabs/SoL-Pi