arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯T1终端智能体硬刚GPT-5.4,300多步工具调用不掉链

作者:arXivDaily编辑部 arXiv 2609.11042 cs · cs.AI · cs.LG

论文导读

腾讯Hy基础模型前沿团队、新加坡国立大学等机构提出T1,让122B混合专家模型在真实云端终端里连续调用工具300多步。它在Terminal-Bench 2.1上解决64.0%的任务,同一测试框架下高于GPT-5.4的54.8%;测试在隔离沙箱完成,不能直接等同于生产系统自治能力。

长任务难在每一步都会改变后面的环境

补一个函数和连续修复一套软件不是同一种任务。终端智能体需要读取文件、安装依赖、运行测试、定位错误,再根据执行结果改下一步。一次错误会留在环境里,任务越长,前面留下的状态越容易拖垮后面的判断。

T1直接在云端沙箱执行命令,每个任务带有资源限制、参考解法和隐藏验证器。单条轨迹最多超过300次工具调用,模型看到的不是静态问答,而是一段会持续变化的终端历史。训练集与Terminal-Bench 2.1的89个测试任务隔离,团队用合成任务训练,再检查能力能否迁移。

图2:任务、推理副本、轨迹组装、训练器和沙箱组成T1的长程强化学习流程。

奖励不只看最终成败,而是数通过了多少项检查

长任务只给“成功或失败”一个信号,几十到几百步动作很难知道哪里做对了。T1把验证器中的每条断言拆开,按通过数量给出密集奖励。模型即使没有完成整项任务,也能从已经通过的测试里得到方向;验证器过弱或可被钻空子的任务会在数据侧过滤。

混合专家模型还存在训推不一致。生成轨迹和训练更新使用不同执行栈,文本重新编码会改变Token,路由器也可能把同一Token送到不同专家。T1用Token-In-Token-Out保留实际采样的Token,再重放生成时的专家路由,使训练真正更新产生这段轨迹的路径。

64.0%不是所有终端任务都能做

在相同智能体框架下,基础模型通过率43.8%,监督微调后49.4%,强化学习后的T1达到64.0%。GPT-5.4为54.8%,DeepSeek-V4-Flash为56.9%,Claude Opus 4.6为63.8%,Claude Opus 4.7仍以66.1%更高。论文因此支持“在这一基准和框架下超过GPT-5.4”,不支持全面超过。

图10:基础模型、监督微调和强化学习阶段在Terminal-Bench 2.1上的通过率变化。

长程任务上,T1在Long-Horizon Terminal Bench达到27.9%,说明多数更难任务仍未解决。成功率提升也伴随交互变长:模型平均回合数明显高于微调和基础版本,部分失败来自反复搜索、错误修复和缺少高层计划。

图12b:训练过程中回合数与序列长度上升后趋于稳定。

下一步要把长程成功率和执行成本一起算

T1展示了大规模混合专家模型可以在可执行验证器上稳定做长程强化学习。下一步要减少无效探索,让模型更早识别错误路线,并补上对单一奖励因素、异步陈旧性和验证器完整性的控制实验。

真正接近软件工程部署时,还需加入权限隔离、人工审批、回滚和成本上限。论文中的沙箱结果适合检验训练方法;生产环境是否可靠,要看模型在真实仓库、私有依赖和不可逆操作下能否保持同样的可验证行为。

参考资料

https://arxiv.org/abs/2609.11042

https://arxiv.org/html/2609.11042

https://jyyang26.github.io/t1/