arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-24 至 2026-02-24 共收录 3 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 3 篇

2602.20048 2026-02-24 cs.AI cs.SE 62%

CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence

CodeCompass: 在代理代码智能中导航悖论的探索

Tarakanath Paipuru

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 CodeCompass通过基于图的结构导航提升代码智能代理在隐藏依赖任务中的性能,揭示导航与检索本质不同,需显式引导代理利用结构上下文。

Comments 23 pages, 7 figures. Research study with 258 trials on SWE-bench-lite tasks. Code and data: https://github.com/tpaip607/research-codecompass

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00672 2026-02-24 cs.LG cs.AI 62%

ML-Tool-Bench: Tool-Augmented Planning for ML Tasks

ML-Tool-Bench: 为机器学习任务增强的工具辅助规划

Yaswanth Chittepu, Raghavendra Addanki, Tung Mai, Anup Rao, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ML-Tool-Bench,通过引入内存中的命名对象管理,评估工具增强的ML代理,改进了ReAct方法,提升了16.52个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏