SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?
SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。
MAPS: 一种多语言评估基准,用于代理性能和安全
机构 * Fujitsu Research of Europe(富士通欧洲研究部) ; Fujitsu Limited(富士通有限公司) ; Cohere
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。
Comments Accepted to EACL 2026 findings
利用大语言模型代理和数字孪生进行过程厂故障处理
机构 * Institute of Automation Technology Helmut Schmidt University Hamburg(海因里希·施密特大学汉堡自动化技术研究所) ; Autonomous Industrial Systems Lab, Imperial College London(伦敦帝国理工学院自主工业系统实验室)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型代理和数字孪生技术,实现过程厂故障的自动处理与纠正,通过模拟验证有效缓解管道堵塞问题。