上海财经大学与复旦大学研究者的一项开源社区模拟发现,引入编码智能体后,完成任务数增加39%,中位完成时间从45分钟缩短到20分钟;同一批工作留下的公共知识更难被后续开发者利用,标准化检索中的覆盖率只有22.3%,真实人类语料为81.1%。
论文图1:历史GitHub数据用于构建开发者、仓库和协作关系,再分成有无编码智能体的平行条件。
同一社区状态被分成两条四周时间线
研究使用1084名活跃开发者及其仓库关系初始化多智能体模拟,并用历史提交完成预热。随后从同一状态分叉:一条不提供编码智能体,另一条允许开发者发现并采用工具,两组各运行四周。
有智能体的一组计划任务增加34%,完成任务增加39%。开发者完成单项任务的中位时间由45分钟降到20分钟。采用率只有26%,生产力提升更多集中在原本活跃且连接紧密的开发者身上。
论文图2局部:编码智能体条件下计划与完成任务更多,完成时间更短。
人类直接协作从32.4%降到11.6%
团队把任务执行分成四种路径,包括直接人—人协作、独立完成和带智能体的自循环。引入工具后,人类直接互动占比从32.4%降到11.6%;含智能体的路径升至57.3%,其中40.3%由“开发者—智能体”自循环完成。
论文图4:任务可以经由人际协作、个人执行或编码智能体参与的路径完成。
更多讨论、审阅理由和问题解决过程从公开仓库转入私密的人机对话。最终代码仍可能提交,但中间解释没有完整进入issue、PR和评论记录。
论文图5:引入编码智能体后,直接人际互动缩小,智能体参与路径成为主要组成。
39%不是现实社区的因果结论
公共知识测试把两种条件产生的语料用于后续检索。智能体组覆盖率22.3%,真实人类语料达到81.1%,智能体组还需要更多检索步骤且成功率更低。这组结果描述模拟生成记录的可复用性,不等于开源代码质量下降了58.8个百分点。
实验由大模型驱动的代理执行,只有四周,也没有让真实开发者在两个平行社区中工作。模型会继承提示词、角色设定和评价规则的偏差。39%的任务增幅与知识覆盖差距都应视为机制模拟,而非企业采用编码智能体后的确定回报。
研究提出了一个可以现实测量的问题:团队统计交付速度时,也应检查讨论、设计理由和失败经验是否进入可搜索的公共记录。否则短期任务更快完成,后来的维护者仍可能重新付出理解成本。