论文导读
阿里通义、清华大学提出Terminal-Universe,把代码智能体留下的一次性操作轨迹还原成可重复运行的终端环境。系统从公开轨迹构建3.73万个环境,训练Qwen3.5-27B后,单轮与多轮基准分别提升11.9和13.8分;恢复过程包含智能体补全,结果依赖论文的模型与验证器。
轨迹是一段录像,环境才可以反复出题
代码智能体的操作日志已经很多,其中记录了读文件、改代码、运行测试和安装依赖的过程。但一条轨迹只能展示一次既定任务;后训练真正需要的是可执行工作区,同一环境可以重新提问、运行验证器并获得新的反馈。
Terminal-Universe利用日志里的文件操作反向恢复环境。系统回放每次修改,把文件还原到智能体动手前的状态,先得到一个不完整工作区,再由补全智能体补上缺失文件和依赖。
图:论文总览图展示从冻结轨迹回放文件操作、恢复工作区并再次出题的过程。
先重建原任务,再扩展宽度和深度
恢复后的工作区先用来重建原始意图,确认任务与验证方法仍可执行。随后系统沿两个方向扩展:宽度上挖掘相关环境间的依赖关系,合成跨代码库查询;深度上把单轮需求延长成多轮会话,让用户智能体继续提出修改意见。
这套做法把“完成一个补丁”扩成“在同一工程里继续改需求”。开发者常要跨库定位问题,也会在第一次结果后补充边界条件,多环境和多轮设置更接近这类工作流。
图:论文图统计恢复环境中的语言、基础设施、机器学习等任务组成。
3.73万个环境带来两项基准提升
系统应用于公开终端智能体轨迹后,生成3.73万个足以支持任务执行的环境。Qwen3.5-27B在这批数据上监督微调后,Terminal-Bench 2.1单轮成绩提高11.9分,EvoCode-Bench v2的多轮MT@4提高13.8分。
环境并非完整复制原开发机器。日志只能暴露部分文件与依赖,缺口由智能体补全,自动验证也可能接受表面通过但语义不完整的实现。论文成绩证明这套重建数据对指定训练和基准有效,不能推成所有轨迹都能无损还原。
图:论文案例时间线展示初始任务经过用户反馈扩展为多轮修改。
下一步要提高环境真实性和许可证追踪
后续可把网络服务、数据库状态和构建缓存纳入恢复,同时记录每个文件来自原轨迹还是智能体补全。只有来源边界清楚,研究者才能判断成绩来自真实工程结构还是合成捷径。
大规模使用还需处理依赖失效、恶意脚本和许可证。安全沙箱应限制网络、凭据和系统调用,数据管线则需保留代码来源与许可信息,避免可执行环境把普通文本数据集没有的风险带进训练。