arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-09-01 至 2026-09-01 共收录 73 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 23 篇

2608.30701 2026-09-01 cs.SE 新提交 79%

A Phased Workflow for Operating LLM-Based Coding Agents

操作基于大语言模型(LLM)的编码智能体的分阶段工作流

Ante Kapetanovic, Tomislav Duricic, Andro Mercep, Emanuel Lacic

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究提出Infobip团队开发的四阶段编码智能体操作工作流,通过前置人力审查、分阶段上下文管理应对故障,同时指出工作流有效性指标缺失等两个未解决问题。

Comments 2 pages, industry paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28972 2026-09-01 cs.SE 新提交 79%

Legacy System Modernization with Coding Agents: A Case Study

基于编码智能体的遗留系统现代化:一项案例研究

Iago da Silva Rodrigues Alves, Cristiano Politowski, João Eduardo Montandon

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究通过工业案例评估Claude Code智能体迁移企业ERP系统功能的效果,发现其平均等价率70%,低级功能表现优于高级功能,同时探讨了该方法的适用场景及局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19319 2026-09-01 cs.MA cs.AI cs.DB 版本更新 79%

Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents

数据智能代理:通过自主编码代理解释、建模和查询企业数据

Anoushka Vyas, Aarushi Dhanuka, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28632 2026-09-01 cs.AI cs.CL cs.LG 新提交 78%

AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment

AutoScientist-Quant:用于量化投资自动研究的自进化编码智能体

Zongqian Li, Yaoyiran Li, Yaohui Guo, Ming Zhang, Nigel Collier, Eugene Ie

机构 * Google(谷歌公司) University of Cambridge(剑桥大学)

专题命中 软件智能体 :coding agent(title);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoScientist-Quant是将量化研究视为带预算约束搜索问题的自进化编码智能体,修复了评估流程的前瞻问题,在CSI universe等场景下实现最优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23763 2026-09-01 cs.NI 版本更新 78%

AgenticNet: Utilizing AI Coding Agents To Create Hybrid Network Experiments

AgenticNet:利用AI编码代理创建混合网络实验

Majd Latah, Kubra Kalkan

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 AgenticNet通过AI编码代理提供混合网络实验工具,支持纯模拟、纯仿真和混合模式,提升实验灵活性和开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29831 2026-09-01 cs.CL cs.SE 新提交 76%

A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

A^2Agent:面向仓库级代码定位智能体的动作感知强化学习方法

Doyeon Kim, Suyoung Bae, Yumin Lee, Jee-Hyong Lee

机构 * College of Computing and Informatics(计算与信息学院) Sungkyunkwan University(成均馆大学)

专题命中 软件智能体 :repository(title);分类 cs.SE、cs.CL

AI总结 A^2Agent是一种动作感知强化学习方法,通过优化奖励与优势估计,在SWE-Bench的两个基准上提升代码定位性能,且4B模型优于更大规模的基线。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08311 2026-09-01 cs.SE cs.AI 版本更新 76%

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.AI

AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-09-01 cs.SE cs.LG 版本更新 73%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Jiajun Cao, Shihab Rashid, Mononito Goswami, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29204 2026-09-01 cs.SE cs.AI 新提交 62%

AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent

AgentLogs:用于揭开GitHub云智能体黑箱的数据集

Jonan Richards, Kosei Horikawa, Youmei Fan, Yutaro Kashiwa, Mairieli Wessel

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出AgentLogs数据集,包含GitHub上35810个热门仓库的智能体任务、会话及6400余万条日志,可用于研究智能体行为、协作等,填补了智能体贡献过程数据的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-09-01 cs.SE cs.AI 版本更新 62%

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Abhik Roychoudhury, Sungmin Kang, Baishakhi Ray

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交 57%

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29460 2026-09-01 cs.AI cs.CR cs.CY 新提交 57%

Can escalation channels redirect reward hacking toward defect disclosure?

升级渠道能否将奖励黑客行为转向缺陷披露?

Francesca Gomez

机构 * Wiser Human(怀瑟人类)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究评估升级渠道作为决策环境干预措施,结合反奖励黑客策略可大幅减少编码智能体的奖励黑客行为,同时提升缺陷检测覆盖率,将智能体能力转向缺陷披露而非利用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-09-01 cs.AI cs.LO cs.MA 版本更新 57%

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments https://prove2.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27787 2026-09-01 cs.MA cs.CL 版本更新 57%

Long Live the Librarian! A Persistent Search Sub-Agent for Energy-Efficient Multi-Agent Software Engineering Systems

图书馆员万岁!面向节能多智能体软件工程系统的持久搜索子智能体

Seunghyuk Cho, Sunghyun Choi, Jaeseung Heo, Youngbin Choi, Saemi Moon, MoonJeong Park, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 针对多智能体系统中输出令牌冗余导致的高能耗问题,提出持久搜索子智能体Librarian,通过跟踪仓库搜索历史并抑制重复探索,减少输出令牌量,在SWE-Bench Verified上实现高达25%的GPU能耗降低且不损失任务性能。

Comments 2026 EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-09-01 cs.AI 版本更新 57%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 程序修复 1 篇

2506.08311 2026-09-01 cs.SE cs.AI 版本更新 81%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26). Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 12 篇

2608.29995 2026-09-01 cs.CL cs.AI 新提交 62%

Generating Clinical Vignettes that Preserve Cognitive Formulations

生成保留认知构想的临床案例 vignettes

Amit Oren, Nimrod Hertz-Palmor, Dean Ariel, Guy Laban

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Cambridge(剑桥大学) Clalit Health Services(克拉利特医疗服务机构) Tel Aviv University(特拉维夫大学) School of Brain Sciences and Cognition, Ben-Gurion University of the Negev(内盖夫本-古里安大学脑科学与认知学院) Azrieli National Center for Autism and Neurodevelopment Research(阿兹里利国家自闭症与神经发育研究中心)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于理论的 FORMA 框架,将认知模型编译为图来生成符合临床结构的创伤后应激障碍案例 vignettes,经评估其质量高且人口统计学差异小,可作为合成临床文本生成的可审计规范。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code and data: https://github.com/Amit-Oren/FORMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28641 2026-09-01 cs.CL cs.AI 新提交 62%

Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture

Terminal-Bench-LILT:基于语言、区域与文化的多语言智能体编码基准

Yunsu Kim, Kaden Uhlig, Ashwin Purohit, Milind Agarwal, Patrick Simianer, Anil Arslan, Kiarash Mokhtari, Thomas Zenkel, Johannes Mosig, Gabriel Bretschner, Shamik Bose, Joern Wuebker, John DeNero

机构 * LILT, Inc.(LILT公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Terminal-Bench-LILT多语言编码基准,含10种语言300个任务,评估6个前沿模型发现其通过率仅63.1%,凸显多语言编码能力是未被充分探索的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-09-01 cs.CL cs.AI 版本更新 62%

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun, Xiao Huang

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-01 cs.AI 新提交 57%

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28802 2026-09-01 cs.CV cs.AI 新提交 57%

A Large-scale Evaluation of Text-guided Models for Facial Editing

文本引导的人脸编辑模型的大规模评估

Rahul Nair, Saurav Pandit, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Prelight Inc(普雷莱特公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本研究对6种文本引导模型开展首次大规模人脸编辑评估,构建含169个属性的Face-Edit-Attributes数据集,发现多数模型头发配饰编辑表现好但姿态编辑差,存在过度编辑及针对深色皮肤男性和老年面孔的偏差。

Comments ACM Multimedia (ACMMM) 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-09-01 cs.AI cs.MA 版本更新 57%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20406 2026-09-01 cs.LG stat.AP 版本更新 57%

Machine Learning and ARIMA Model Averaging for Adaptive Public Health Forecasting: Comparative Evaluation and an Ontario COVID-19 Case Study

机器学习与ARIMA模型平均法用于自适应公共卫生预测:比较评估及安大略省COVID-19案例研究

Yushu Zou, Ye Li, Johra Moosa, Martin Grunnill, Samir N. Patel, Venkata R. Duvvuri

机构 * Public Health Ontario(安大略省公共卫生局) Dalla Lana School of Public Health, University of Toronto(多伦多大学达拉·拉纳公共卫生学院) University of Toronto(多伦多大学) York University(约克大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究评估ARIMA、随机森林、XGBoost模型,提出MLAMA集成方法,基于安大略省COVID-19数据验证其预测性能更优,支持按操作条件选择预测模型。

Comments This paper has been withdrawn by the author due to organizational policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-09-01 cs.MA cs.AI 版本更新 57%

MAS-on-the-Fly: In-Context Structural Adaptation of LLM-Based Multi-Agent Systems

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17648 2026-09-01 cs.CL 版本更新 57%

Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems

Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包

Marco Gaido, Sara Papi, Mauro Cettolo, Matteo Negri, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 研究流式语音到文本翻译在评估上的问题,提出开源框架simulstream,支持长语音的增量和重新翻译解码,能进行质量和延迟评估及实时可视化比较,填补了相关统一解决方案的空白。

Comments Accepted to EMNLP demo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29955 2026-09-01 cs.HC 新提交 50%

A Cyber-Physical Machine Tool Framework with a Real-Time Machining Process Digital Twin

具备实时加工过程数字孪生的信息物理机床框架

Khalil Chakal, Tero Kaarlela, Jose Outeiro, Carlos Andrade

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出一种分层数字孪生框架,扩展现有信息物理机床框架,集成多类数据实现机床与加工过程同步,经实验验证性能达标,为AI辅助加工应用奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28877 2026-09-01 physics.optics cs.MA 新提交 50%

HALO: A Physics-Aware LLM Agent Framework for Nanophotonic Design

HALO:用于纳米光子设计的物理感知大语言模型智能体框架

Yubo Zhang, Jinlin Xiang, Zijun Zhao, Yang Zhao, Eli Shlizerman, Arka Majumdar

专题命中 代码评测 :coding agent(abstract)

AI总结 该研究提出HALO框架及52任务基准HALO-Bench,对比三类规划器配置,发现固定结构化工作流效率最高,自主编码成功率更高但故障更多,复用失败轨迹可减少迭代与令牌使用,明确了科学智能体的相关权衡。

Comments 9 pages, 3 figures, 5 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09882 2026-09-01 quant-ph cs.DC cs.PF 版本更新 50%

Benchmarking Zero-Setup Quantum Circuit Simulators

零设置量子电路模拟器的基准测试

Arul Rhik Mazumder, Hovnatan Karapetyan, Mohammed Zuhair Mullath, Rudy H. Tanin, Hrant Gharibyan, Hayk Tepanyan

专题命中 代码评测 :repository(abstract)

AI总结 该研究对GPU加速的MPS和PPS量子模拟方法进行基准测试,比较多个工具,发现MPS中GPU运行时随键维度次二次缩放,PPS中GPU在特定基准测试下加速显著且能达高精度,还提供模拟器特征描述及代码配置仓库。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 13 篇

2608.30300 2026-09-01 cs.SE 新提交 79%

Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency Upgrades?

来自地狱的更新:编码智能体能否在依赖升级的隐藏损坏中存活?

Zijian Luo, Runzhi He, Pengfei Gao, Yu Kang, Zeqi Lin, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Yongqiang Tian

专题命中 仓库级理解 :coding agent(title,abstract);分类 cs.SE

AI总结 本文推出含203项真实依赖升级任务的DEPBENCH基准,评估主流编码智能体后发现其仅解决51.2%任务,凸显当前智能体能力与软件维护需求的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏