ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?
ISO-Bench: 编码代理能否优化现实世界的推理工作负载?
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG
AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
ISO-Bench: 编码代理能否优化现实世界的推理工作负载?
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG
AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。
当AI队友遇见代码审查:协作信号塑造代理编写的拉取请求整合
机构 * Idaho State University USA(爱达荷州立大学)
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究探讨了AI代理提交的拉取请求在代码审查中的整合效果,发现审查员参与和协作信号对整合成功至关重要。
Comments 5 pages, 2 figures, 1 table. Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026), Rio de Janeiro, Brazil
关于Maven包重建中源代码变化性的研究
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 本文研究了Maven包重建中源代码变化性问题,发现构建扩展生成的代码导致非等价源代码,提出应对策略。
Ambig-SWE: 交互式代理以克服软件工程中的不充分性
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 软件智能体 :code generation(abstract);分类 cs.AI
AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。
Comments 22 pages, 7 figures, Accepted at ICLR 2026