arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12148 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2606.13468 2026-06-12 cs.SE cs.AI 新提交 62%

Understanding the Rejection of Fixes Generated by Agentic Pull Requests -- Insights from the AIDev Dataset

理解AI代理生成的拉取请求修复被拒绝的原因——来自AIDev数据集的洞察

Mahmoud Abujadallah, Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过分析AIDev数据集,发现46.41%的AI代理(Copilot、Devin、Cursor、Claude)提出的代码修复被拒绝。本文对306个未合并的PR进行定性研究,归纳出14个拒绝原因,分为四类,并提出了改进模型引导的建议。

Comments 5 pages, 2 figures, MSR '26: Proceedings of the 23rd International Conference on Mining Software Repositories, April 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13449 2026-06-12 cs.SE cs.AI 新提交 62%

Toward Instructions-as-Code: Understanding the Impact of Instruction Files on Agentic Pull Requests

面向指令即代码:理解指令文件对智能体拉取请求的影响

Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 通过分析148个项目的15549个智能体PR,发现指令文件对合并率、代码变更量和合并工作量无一致正面影响,但成功项目指令文件更长且结构更清晰,提出“指令即代码”研究方向。

Comments 5 pages, 8 figures, 23rd International Conference on Mining Software Repositories, April 13--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11976 2026-06-11 cs.SE cs.AI 新提交 62%

Exploration Structure in LLM Agents for Multi-File Change Localization

LLM代理中的探索结构用于多文件变更定位

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06547 2026-06-11 cs.CR cs.AI cs.CL cs.ET 版本更新 62%

"Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills in the Wild

“不要向用户提及此事”:检测与理解恶意代理技能

Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Zhejiang Key Laboratory of Digital Fashion and Data Governance, Zhejiang Sci-Tech University(浙江数字时尚与数据治理重点实验室,浙江科技大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对两个主要注册中心的98,380个技能进行系统安全分析,结合静态模式匹配和动态行为验证,识别出157个恶意技能,揭示了13种攻击技术中的632个不同漏洞,并发现攻击复杂性与隐藏投入相关。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07586 2026-06-10 cs.LG cs.AI cs.AR cs.MA 版本更新 62%

From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs

从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统

Jiajie Li, Erwei Wang, Zhiru Zhang, Samuel Bayliss

机构 * AMD Research and Advanced Development(AMD研究与高级开发)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 62%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交 62%

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 62%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05548 2026-06-05 cs.SE cs.AI 62%

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

ADK Arena: 通过LLM即开发者评估智能体开发工具包

Jintao Huang, Xiaomin Li, Gaurav Mittal, Yu Hu

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出LLM-as-a-Developer方法,通过自动化流水线ADK Arena评估51个Python ADK框架,发现框架间生成成本差异达5.6倍,但无单一框架占优,且文档、源码和参数知识可相互替代。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25289 2026-06-04 cs.LG cs.AI 62%

ClustRecNet: A Novel End-to-End Deep Learning Framework for Clustering Algorithm Recommendation

ClustRecNet: 一种用于聚类算法推荐的新型端到端深度学习框架

Mohammadreza Bakhtyari, Bogdan Mazoure, Renato Cordeiro de Amorim, Guillaume Rabusseau, Vladimir Makarenkov

机构 * Département d’Informatique, Université du Québec à Montréal(魁北克大学蒙特利尔分校计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所) School of Computer Science and EE, University of Essex(埃塞克斯大学计算机科学与电子工程学院) Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系)

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出ClustRecNet,一种端到端深度学习框架,通过直接学习原始表格数据的高阶表示来推荐合适的聚类算法,在合成和真实基准上优于传统内部聚类有效性指标和AutoML方法。

Comments Published in IEEE Access

Journal ref IEEE Access, vol. 14, pp. 81352 - 81365, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI 62%

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23866 2026-06-02 cs.SE cs.CL 62%

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

SWE-rebench V2: 大规模语言无关的SWE任务集合

Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Alexander Golubev

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL

AI总结 提出语言无关的自动化流水线SWE-rebench V2,用于大规模收集可执行的软件工程任务并构建RL训练环境,产出涵盖20种语言、3617个仓库的32079个任务数据集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31464 2026-06-01 cs.LG cs.AI 62%

GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization

GPU预测器:语言模型作为内核运行时优化的选择性替代

Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) AI2 Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究利用语言模型作为GPU内核性能的选择性替代,通过强化学习提高预测准确性和校准度,在有限GPU评估预算下加速内核搜索。

Comments Code: https://github.com/codezakh/gpu-forecasters

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 62%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30003 2026-05-29 cs.MA cs.AI cs.LG 62%

Discovering Cooperative Pipelines: Autoresearch for Sequential Social Dilemmas

发现合作管线:面向序列社会困境的自动研究

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种双层自动研究框架,其中外层AI智能体自动重新设计内层LLM策略合成管线,以解决多智能体序列社会困境,实验表明该方法在多个游戏和福利目标下优于手工基线。

Comments Accepted to the AI Agents for Discovery in the Wild (AID-Wild) Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28876 2026-05-29 cs.SE cs.AI 62%

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

LogDx-CI:为LLM根因诊断基准测试日志缩减工具

Bowen Qin

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出LogDx-CI基准,比较11种日志缩减工具在35个真实CI故障案例上的效果,发现混合grep+tail路由器在成本质量上占优,且智能体循环可缩小质量差距但成本差异持续存在,同时跨家族LLM摘要器优于同家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24183 2026-05-26 cs.DB cs.AI cs.LG 62%

AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

AvalancheBench: 通过潜在世界恢复评估企业数据智能体

Darek Kleczek, Fuheng Zhao, Alexander W. Lee, Julien Tissier, Pawel Liskowski, Ugur Cetintemel, Anupam Datta

机构 * Brown University and Snowflake(布朗大学和Snowflake)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出AvalancheBench基准,通过潜在世界恢复评估企业数据智能体的分析理解能力,揭示早期错误如何传播并导致系统性错误推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24096 2026-05-26 cs.DB cs.AI cs.DC cs.SE 62%

The Time is Here for Just-in-Time Systems: Challenges and Opportunities

即时系统的时代已到来:挑战与机遇

Shu Liu, Alexander Krentsel, Shubham Agarwal, Mert Cemri, Ziming Mao, Soujanya Ponnapalli, Alexandros G. Dimakis, Sylvia Ratnasamy, Matei Zaharia, Aditya Parameswaran, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出基于LLM的即时系统合成方法Jitskit,通过从零开始合成专用键值存储系统,在18个规格上性能超越现有系统最高达4.6倍。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL 62%

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.PL

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI 62%

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 软件智能体 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11060 2026-05-21 cs.SE cs.AI 62%

Code Researcher: Deep Research Agent for Large Systems Code and Commit History

Code Researcher: 用于大型系统代码和提交历史的深度研究代理

Ramneet Singh, Sathvik Joel, Abhav Mehrotra, Nalin Wadhwa, Ramakrishna B Bairi, Aditya Kanade, Nagarajan Natarajan

机构 * Microsoft Research(微软研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Code Researcher,一种用于大型系统代码和提交历史的深度研究代理,通过多步骤推理和全局上下文收集,有效解决系统代码崩溃修复问题,显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI 62%

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 62%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09283 2026-05-12 cs.AI cs.CL 62%

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

面向可靠重用的AI生成内容结构化框架

Shusaku Egami, Masahiro Hamasaki

机构 * National Institute of Advanced Industrial Sciencen

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结构化框架,通过在生成时自动附加元数据,提升AI生成内容的可追溯性和可靠性,以支持其安全重用。

Comments 5 pages, 2 figures, Accepted at FAAW@WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07127 2026-05-11 cs.LG cs.CL 62%

The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

位置诅咒:LLM在列表中定位最后几个项目时表现不佳

Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson, Mikio Aoi, Marcelo G. Mattar, Li Ji-An

机构 * UC San Diego(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) New York University(纽约大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 LLM在定位长列表中单个相关项目时表现优异,但在短列表中最后几个项目定位上存在缺陷,即位置诅咒。通过构建PosBench数据集进行微调后,虽然提升了定位能力,但仍未达到理想水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06717 2026-05-11 cs.SE cs.AI 62%

Agentic Coding Needs Proactivity, Not Just Autonomy

代理编码需要主动性,而非仅仅自主性

Nghi D. Q. Bui, Georgios Evangelopoulos

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05400 2026-05-08 cs.SE cs.AI cs.HC 62%

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

代理编程的准备:作为情境工程方法论的刻意准备

Andrew Zigler

机构 * LinearB

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种三阶段的代理编程准备方法,通过情境 grounding、协作规范和任务分解,提升 AI 编程的效率与质量,通过 hackathon 实验验证了准备阶段的重要性。

Comments 5 pages. Accepted at VibeX 2026, the 1st International Workshop on Vibe Coding and Vibe Researching, co-located with EASE 2026, Glasgow, June 9-12 2026. Camera-ready version. Research artifact: https://doi.org/10.5281/zenodo.19868258

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16323 2026-05-05 cs.SE cs.AI 62%

Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development

超越'差异':应对代理软件开发中的代理熵

Matteo Casserini, Alessandro Facchini, Andrea Ferrario

机构 * Dipartimento Tecnologie Innovative, SUPSI(技术创新部,SUPSI) Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理(MINDS)系,科津斯基大学) Institute of Biomedical Ethics and History of Medicine, University of Zurich(生物医学伦理与医学史研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种过程导向的可解释框架,通过时间、工具调用和架构边界揭示代理决策过程,解决代理行为与架构意图的偏离问题,为代理监控提供意图层面的 telemetry。

Comments Camera-ready version of the position paper accepted to the Human-Centered Explainable AI (HCXAI) Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 62%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏