论文导读
英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将Token消耗削减近半。在基准评测中,该系统使前沿大模型编程API成本直接下降50%至54.3%,每小时运行成本立省13.5美元。
长轨迹交互失控:AI自主写代码为何费用爆炸
随着大模型从简单的单轮代码补全转向全自主软件工程,智能体需要独立面对真实代码仓库。在定位缺陷、阅读文件、执行终端命令和运行单元测试的长程循环中,上下文长度迅速膨胀。多步交互积累的终端输出与文件内容使得每次API调用都需要反复传递巨量历史信息。
这种冗余不仅让开发者面临昂贵账单,更制约了智能体的长时间持续搜索。面对动辄上千步的复杂项目重构,未经优化的交互脚手架往往在任务尚未完成前就耗尽预算,或者因过长上下文诱发注意力衰减,导致代码修复成功率断崖式下滑。
图:智能体自动化研究循环流程与在保留测试集上的性能与API成本对比
AI优化AI:自动闭环筛选四项底层压缩机制
为了在不损害代码智能的前提下压缩上下文开销,联合团队提出了名为SoL-Pi的自动研究循环。系统让专职的科研AI审查基线智能体的执行轨迹,自主提出压缩创意并搭建实验,严格通过性能保持与成本门禁双重筛选。经过持续演化,系统最终沉淀并固化了四项关键机制。
这四项机制贯穿智能体与环境交互的全生命周期:动作融合机制将代码修改与后续执行命令合并为单次请求,大幅削减轮次开销;在线上下文紧缩在子任务收尾时动态预估收益并选择性压缩;观察打包机制对大体量终端回显采用两轮后切片折叠与稳定句柄索引;证据保留精简器则依托低成本轻量模型对冗长日志进行确定性提炼与回退兜底。
图:展示动作融合、在线上下文紧缩、观察打包与证据保留精简四项机制的执行路径
严苛测试验证:Token减半,任务解决率完全保持
在与真实研发环境隔离的EdgeBench测试集上,研究团队将SoL-Pi分别与GPT-5.6 Sol以及Claude Opus 5两大前沿主力模型结合展开了成对对比测试。
实验数据显示,SoL-Pi实现了惊人的效率跃升。在GPT-5.6 Sol上,智能体的API调用成本整调整整下降了50.0%,总Token消耗降低49%;而在Claude Opus 5上,成本降幅更是达到了54.3%。更为可贵的是,这一压缩并未带来任何任务解决率的妥协,智能体在两类模型上的代码通过率与基准版本保持完全一致。
图:群体看板架构与两小时搜索中智能体执行循环轮数与成本消耗的对比
图:展示27轮优化迭代中动作融合机制如何逐步通过质量与成本门禁并被固化
在群体协同实验中,SoL-Pi群体在两小时内平稳完成了1127次研究循环,总开销仅为60.11美元;而动作融合机制的迭代历程表明,系统在27轮严谨演化中彻底杜绝了虚假压缩与性能回退。
自主研发普及化:长周期自动化软件工程落地
SoL-Pi的突破证明了智能体交互框架本身的工程优化潜力,为全天候自主软件维护提供了高经济性的可行路线。
研究团队指出,下一步将推动这些经过自动研究所验证的交互策略与主流开源智能体框架全面兼容,并探索将该压缩闭环推广至数据分析、系统运维与自动化科研等更广阔的长程智能体应用场景。