arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-26 至 2026-08-26 共收录 42 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 8 篇

2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 62%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24439 2026-08-26 cs.CV 新提交 50%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 代码评测 :repository(abstract)

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仓库级理解 9 篇

2608.23619 2026-08-26 cs.SE cs.AI 新提交 81%

Identifying Latent Declarative Representations of Code for Assisting Repository Migration

识别代码的隐式声明式表示以辅助代码仓库迁移

Shraddha Surana, Ashwin Srinivasan, Michael Bain

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究针对遗留代码仓库迁移难题,提出 ADFD-Migrate 方法,通过显式化代码的隐式声明式表示提升移植效果,在新基准 f2x50 上取得优于对比方法的移植正确性与完整性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24807 2026-08-26 cs.SE cs.AI 新提交 62%

Automatic Model Card Generation Using an LLM

基于大语言模型的自动模型卡片生成

Tajkia Rahman Toma, Balreet Grewal, Cor-Paul Bezemer

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 62%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23754 2026-08-26 cs.SE 新提交 57%

Enhancing Bug Report Templates in the TianoCore UEFI Firmware Development Community

增强TianoCore UEFI固件开发社区中的漏洞报告模板

Laura Baird, Neelesh Reddybattula, Nazanin Siavash, Terrance E. Boult, Armin Moin

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对TianoCore核心项目EDK II,通过分析漏洞数据发现关键信息缺失问题,拟在GitHub Issues的漏洞报告模板中新增字段,计划经开发者反馈调整及A/B测试验证,以优化UEFI固件漏洞分类与解决流程。

Comments ACM International Workshop on Firmware Testing and Analysis (FTA) 2026, Co-located with ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-08-26 cs.AI 版本更新 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23602 2026-08-26 cs.AR 新提交 50%

PACT: Post-route Agentic Checkpoint Tuning for FPGA Timing Closure

PACT:面向FPGA时序收敛的后路由代理检查点调优

Huan Lin, Kunlong Li, Lingli Wang, Zhiang Zhang

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出PACT框架,用于Vivado设计检查点的后路由调优,在35个UltraScale+检查点上将F_max几何平均提升22.30%,速度较DATuner快6.4倍,令牌成本仅0.16美元/ DCP。

Comments Accepted to the 2026 International Conference on Field-Programmable Technology (FPT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23659 2026-08-26 math.AP 新提交 50%

Relative formalization in Isabelle/HOL of a result in inverse problems

Isabelle/HOL中关于反问题结果的相对形式化

Cătălin I. Cârstea

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究利用Isabelle/HOL对arXiv:2606.15977中的反问题结果开展自动形式化实验,基于熟知的外部结果完成证明,相关文件已在GitHub仓库公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17723 2026-08-26 cs.CV 版本更新 50%

Implicit Neural Representation-Based Continuous Single Image Super-Resolution: An Empirical Benchmark

基于隐式神经表示的连续单图像超分辨率:一项实证研究

Tayyab Nasir, Daochang Liu, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文通过实证研究探讨了隐式神经表示在连续单图像超分辨率中的有效性,揭示了训练配置对性能的关键影响,并提出了一种增强纹理保真的新损失函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16855 2026-08-26 cs.CV 版本更新 50%

Stack Transformer Based Spatial-Temporal Attention Model for Dynamic Sign Language and Fingerspelling Recognition

基于堆叠Transformer的动态手语与手指拼写识别时空注意力模型

Koki Hirooka, Abu Saleh Musa Miah, Tatsuya Murakami, Md. Al Mehedi Hasan, Yong Seok Hwang, Jungpil Shin

机构 * School of Computer Science and Engineering, The University of Aizu(计算机科学与工程学院,秋田大学) Research Institute for Electronic Science (RIES), Hokkaido University(电子科学研究所(RIES),北海道大学) Department of Electronics Engineering, Kwangwoon University(电子工程系,高阳大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出序列时空注意力网络(SSTAN),在WLASL、JSL、KSL数据集上验证其性能,该模型无需预定义图结构,在手指拼写类别及仅骨骼数据的WLASL任务中达到SOTA,数据效率高。

Comments This paper has been published in the IEEE Open Journal of the Computer Society. DOI: https://doi.org/10.1109/OJCS.2026.3682330

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他AI编程 1 篇

2608.24089 2026-08-26 cs.IR 新提交 50%

CodeHID: Learning an Addressable Hierarchical Code Index for Generative Code Retrieval

CodeHID:学习用于生成式代码检索的可寻址分层代码索引

Zhen Li, Yuhong Chen, Wenhao Xu, Xiaodong Li, Hui Li

专题命中 其他AI编程 :code model(abstract)

AI总结 CodeHID是一种生成式代码检索框架,通过伪邻居引导的文档ID学习与双阶段文档ID生成引导构建分层索引,在CoSQA和ProCQA基准上大幅优于现有检索方法

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏