arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-28 至 2026-08-28 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 5 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 81%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-08-28 cs.SE cs.AI 版本更新 81%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 74%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 软件智能体 :coding agent(title);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26218 2026-08-28 cs.AI cs.SE 新提交 62%

Same Model, Different Harness: Different Coding-Agent Results

相同模型,不同工具链:编码智能体的结果差异

Sydney Lewis

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探究模型与任务固定时,工具链改变对编码智能体结果的影响,发现特定工具链配置可提升模型在编码基准的表现,故编码智能体评估需将模型与工具链共同视为求解器。

Comments 24 pages, 9 figures. Software and study artifacts: this https URL (https://github.com/sydches/yuj)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26130 2026-08-28 cs.CL cs.IR 新提交 57%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏