arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

小米把3185个代码库变训练场,编程智能体五项基准全涨

作者:arXivDaily编辑部 arXiv 2609.22068 cs · cs.AI

论文导读

小米、北京大学、香港大学和中国人民大学提出CodeMidas,只读取源码,就把3185个代码库转成5545项可执行训练任务,覆盖23种语言。使用这些环境训练后,MiMo-V2.5在论文选定的五项编程基准上均有提升,也减少了对现成工单的依赖。

训练题不再依赖现成Issue和提交记录

编程智能体常从真实软件仓库的Issue与修复提交中学习:问题描述提供任务,提交差异给出答案,测试负责验收。这类数据质量高,却只覆盖留下完整记录的项目,而且容易把未来提交、相似补丁或人工描述泄露进训练过程。

CodeMidas换了入口。系统把一个代码库交给智能体探索,要求它理解功能、找到可以扩展或修复的行为,再生成任务描述和测试。任务特定输入只有源码,不需要Issue或提交历史,因此大量“有代码、没工单”的项目也能成为训练环境。

图:论文总览展示代码探索、任务提出、实现与测试筛选的流水线。

先让智能体动手,再用执行结果筛题

系统不是一次性写出题面。探索智能体先运行项目、阅读接口并尝试修改;任务生成器据此提出可操作需求;随后候选解法和自动测试在隔离环境中执行。无法安装、测试不稳定、答案不唯一或过于简单的任务会被过滤。

最终数据集包含5545项任务,来自3185个代码库并覆盖23种编程语言。任务形式不局限于修复一个缺陷,还包括功能实现、完整程序构建和终端操作。多样性让训练信号更接近智能体真实工作时遇到的仓库差异。

图:论文案例展示智能体如何在代码库中执行命令、修改代码并接受测试。

五项基准都上涨,但不能等同于通用工程能力

论文把CodeMidas环境用于MiMo-V2.5训练,并报告模型在五项指定编程基准上均有提升。这支持“源码本身可以规模化提供强化学习任务”的核心判断,也说明可执行测试能给智能体比静态代码续写更明确的反馈。

结果仍受数据选择和测试质量影响。自动生成的测试可能只覆盖表面行为,智能体也可能学会迎合测试而非写出可维护实现。五项基准上涨不代表它已经能处理所有大型代码库、模糊产品需求、跨团队协作或长周期版本迁移。

图:论文结果图比较加入CodeMidas训练前后的多项编程基准表现。

下一步:训练环境也要有供应链审计

这套方法最有潜力的地方,是把训练数据生产从人工整理扩展到可执行仓库。但规模扩大后,许可证、恶意代码、依赖下载和测试隔离会成为基本门槛。每项任务都应记录代码版本、许可证、生成步骤、测试覆盖和失败日志。

更强的评估应使用时间上更晚、仓库上完全隔离的测试集,并检查补丁可读性、性能、安全与兼容性。对于同一需求,还可以准备隐藏测试和人工代码审查,降低模型只针对公开断言“刷题”的空间。

如果任务生成器、解题模型和评测器长期共用同一模型家族,还可能形成共同盲区。让不同模型提出任务、独立工具执行验收,再抽样由工程师复核,会比单一智能体自问自答更可靠。源码能成为训练场,但训练场本身也必须先通过工程质量检查。

参考资料

https://arxiv.org/abs/2609.22068