arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

复杂任务的缩放轨迹:通过递归自我重写

Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite

Zongxia Li, Yucheng Shi, Zhongzhi Li, Junyao Yang, Ruhan Wang, Chengsong Huang, Fuxiao Liu, Haitao Mi, Jordan Boyd-Graber, LeoweiLiang

arXiv 2610.02826首次发表:更新:

发表机构

Tencent HY LLM Frontier; University of Maryland, College Park; University of Georgia; National University of Singapore; Indiana University; Washington University in St. Louis; Nanyang Technological University(腾讯HY大语言模型前沿; 马里兰大学帕克分校; 佐治亚大学; 新加坡国立大学; 印第安纳大学; 圣路易斯华盛顿大学; 南洋理工大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

提出递归自我重写框架,利用单一基础模型在多种执行框架下发现并重构成功轨迹为通用训练数据,显著提升终端任务性能。

AI 中文摘要

困难任务上的成功轨迹为模型改进提供了宝贵的监督信号,但专门的执行框架所引入的干预措施在部署阶段可能不可用。我们提出了递归自我重写(RSR)框架,该框架使用一个基础模型 Qwen-3.8-27B,在多种执行框架下发现成功解决方案,并将其重构为在通用执行框架下的训练轨迹。规划器将过程提取为运行手册,批评器筛选验证器和解决方案泄漏并指导递归修订,执行器在新的沙箱环境中遵循合格的运行手册。在大约 3K 个自策展终端任务中,三种执行框架联合解决了 759 个任务,比记录池中最强的单个执行框架多 34.3%。RSR 将 2,001 条成功源轨迹扩展为 11,094 条重写轨迹,用于监督微调。在这些轨迹上训练优于基础模型和直接轨迹 SFT。与基础模型相比,pass@3 在 Terminal-Bench 2 上从 57.0% 提升到 74.2%,在 Terminal-Bench 4 上从 1.5% 提升到 9.1%,在我们自策展的 Terminal-Bench Hard 上从 39.0% 提升到 63.0%,在我们自策展的 Software Terminal-Bench 上从 3.0% 提升到 6.0%。Long-Horizon Terminal-Bench 上的过程奖励从 0.21 上升到 0.29。这些结果表明,多样化的执行框架辅助经验可以被重构为在通用执行框架下运行的模型的可复用能力。

英文摘要

Successful trajectories on difficult tasks provide valuable supervision for model improvement, but specialized harnesses introduce interventions that may be unavailable during deployment. We propose Recursive Self-Rewrite (RSR), a framework that uses one base model, Qwen-3.8-27B, to discover successful solutions under diverse harnesses and reconstruct them as training trajectories under a general harness. A planner extracts procedures into runbooks, a critic screens for verifier and solution leakage and guides recursive revision, and an executor follows qualified runbooks in fresh sandboxes. Across approximately 3K self-curated terminal tasks, three harnesses jointly solve 759 tasks, 34.3% more than the strongest individual harness in the recorded pool. RSR expands 2,001 successful source trajectories into 11,094 rewritten trajectories for supervised finetuning. Training on these trajectories outperforms both the base model and direct trajectory SFT. Compared with the base model, pass@3 increases from 57.0% to 74.2% on Terminal-Bench 2, from 1.5% to 9.1% on Terminal-Bench 4, from 39.0% to 63.0% on our self-curated Terminal-Bench Hard, and from 3.0% to 6.0% on our Software Terminal-Bench. Process reward on Long-Horizon Terminal-Bench rises from 0.21 to 0.29. These results show how diverse harness-assisted experiences can be reconstructed into reusable capabilities for a model operating under a general harness.

Comments16 pages, 5 figures. Model weights: https://huggingface.co/IntelligenceLab/RSR-27B

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑