arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-16 至 2025-12-16 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2507.00057 2025-12-16 cs.PL cs.AI cs.LG cs.SE 79%

Incoherence as Oracle-less Measure of Error in LLM-Based Code Generation

不一致性作为无 oracle 的错误度量方法在基于 LLM 的代码生成中的应用

Thomas Valentin, Ardi Madadi, Gaetano Sapia, Marcel Böhme

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出了一种无 oracle 的错误度量方法,用于评估基于LLM的代码生成的正确性,通过不一致性度量有效识别错误程序并替代传统 oracle 评估。

Comments Accepted at AAAI'26 (extended version). 8 pages + refs and appendix

Journal ref 40th Annual AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08091 2025-12-16 cs.PL cs.DC cs.PF 74%

LEGO: A Layout Expression Language for Code Generation of Hierarchical Mapping

LEGO:一种用于分层映射代码生成的布局表达语言

Amir Mohammad Tavakkoli, Cosmin Oancea, Mary Hall

专题命中 代码生成 :code generation(title);分类 cs.PL

AI总结 LEGO是一种用于生成分层映射代码的布局表达语言,通过布局规范生成索引表达式,可集成至编译器和模板中,实现数据和计算优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13438 2025-12-16 cs.SE cs.AI 62%

From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents

从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能

Dezhi Ran, Zhi Gong, Yuzhe Guo, Mengzhou Wu, Yuan Cao, Haochuan Lu, Hengyu Zhang, Xia Zeng, Gang Cao, Liangchao Yao, Yuetang Deng, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) SCS, Peking University(SCS,北京大学) Tencent Inc.(腾讯公司) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.AI

AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11922 2025-12-16 cs.SE cs.AI 62%

Vibe Coding in Practice: Flow, Technical Debt, and Guidelines for Sustainable Use

在实践中使用Vibe编码:流程、技术债与可持续使用的指南

Muhammad Waseem, Aakash Ahmad, Kai-Kristian Kemell, Jussi Rasku, Sami Lahti, Kalle Mäkelä, Pekka Abrahamsson

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了Vibe编码在实践中的应用,分析了其与技术债的权衡,并提出了可持续使用的指南和对策。

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 57%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03846 2025-12-16 cs.CL 57%

Do LLM Evaluators Prefer Themselves for a Reason?

大语言模型评估器为何偏好自己?

Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) George Washington University(乔治华盛顿大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在评估时自我偏好现象的成因,发现更强模型更倾向于偏好自身输出,但其中大部分偏好源于客观质量优势,同时提出通过扩展策略可减少有害自我偏好。

Comments Added LMArena experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2512.12806 2025-12-16 cs.AI 74%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 软件智能体 :coding agent(title);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2512.12301 2025-12-16 cs.LG 57%

TwinFormer: A Dual-Level Transformer for Long-Sequence Time-Series Forecasting

TwinFormer:一种用于长序列时间序列预测的双层Transformer

Mahima Kumavat, Aditya Maheshwari

机构 * Operations Management and Quantitative Techniques Area, Indian Institute of Management Indore(印度管理学院印第安纳分校运营管理与定量技术部门)

专题命中 程序修复 :repository(abstract);分类 cs.LG

AI总结 TwinFormer通过双阶段Transformer架构,结合top-k稀疏注意力和GRU聚合,实现高效长序列时间序列预测,优于多种现有方法。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02629 2025-12-16 cs.SE 57%

Parameter-Efficient Fine-Tuning with Attributed Patch Semantic Graph for Automated Patch Correctness Assessment

基于属性补丁语义图的参数高效微调用于自动补丁正确性评估

Zhenyu Yang, Jingwen Wu, Zhen Yang, Zhongxing Yu

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出基于属性补丁语义图的参数高效微调方法,用于提升自动补丁正确性评估的准确性和F1分数。

Comments 20 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13550 2025-12-16 physics.chem-ph cond-mat.str-el physics.comp-ph 50%

DoNOF 2.0: A modern Open-Source Electronic Structure Program for Natural Orbital Functionals

DoNOF 2.0:一种现代的开源电子结构程序用于自然轨道功能

Juan Felipe Huan Lew-Yee, Ion Mitxelena, Jorge M. del Campo, and Mario Piris

专题命中 代码评测 :repository(abstract)

AI总结 DoNOF 2.0是一款开源电子结构程序,提供改进的优化算法、激发态计算和非线性光学响应评估功能。

Comments 11 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12145 2025-12-16 physics.optics 50%

A Thermal Modeling Toolkit for Continuous-Wave Gaussian Second-Harmonic Generation in KTP Crystal

用于KTP晶体连续波高斯二次谐波生成的热模型工具包

Mostafa M. Rezaee, Mohammad Sabaeian, Alireza Motazedian, Fatemeh Sedaghat Jalil-Abadi, Mohammad Ghadri

专题命中 代码评测 :repository(abstract)

AI总结 该工具包提供了一种用于计算KTP晶体连续波高斯二次谐波生成中温度场的开源有限差分方法,支持多种热传导模型和参数化情景扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11884 2025-12-16 cs.CV 50%

Generalization vs. Specialization: Evaluating Segment Anything Model (SAM3) Zero-Shot Segmentation Against Fine-Tuned YOLO Detectors

泛化与专门化:评估Segment Anything Model(SAM3)零样本分割对精细调优的YOLO检测器

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee, Nikolaos D. Tselikas

机构 * Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系) University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃里亚大学信息与电信系)

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了SAM3在零样本分割中的性能,与微调的YOLO检测器相比,展示了SAM3在遮罩精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2510.04146 2025-12-16 cs.LG cs.AI cs.CL 67%

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

超越单个令牌预测:扩散模型与自回归语言模型性能的对比分析

Minseo Kim, Coleman Hooper, Aditya Tomar, Chenfeng Xu, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * Seoul National University(首尔国立大学) University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 仓库级理解 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了扩散模型与自回归语言模型在性能上的差异,发现DLMs在算术强度上占优但难以扩展,而ARMs在批量推理中表现更优。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14613 2025-12-16 math.OC cs.MS 50%

Improved algorithms and novel applications of the FrankWolfe.jl library

改进的Frank-Wolfe.jl库算法与新应用

Mathieu Besançon, Sébastien Designolle, Jannis Halbey, Deborah Hendrych, Dominik Kuzinowicz, Sebastian Pokutta, Hannah Troppens, Daniel Viladrich Herrmannsdoerfer, Elias Wirth

专题命中 仓库级理解 :repository(abstract)

AI总结 本文介绍了Frank-Wolfe.jl库在算法改进和新应用方面的进展,展示了其在解决大规模优化问题中的性能表现。

Journal ref ACM Trans. Math. Softw. 51(4), Article 29, 33 pages (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05900 2025-12-16 cond-mat.mtrl-sci physics.comp-ph 50%

QERaman: An open-source program for calculating resonance Raman spectra based on Quantum ESPRESSO

QERaman:基于Quantum ESPRESSO的开放源代码程序,用于计算共振拉曼光谱

Nguyen T. Hung, Jianqi Huang, Yuki Tatsumi, Teng Yang, Riichiro Saito

专题命中 仓库级理解 :repository(abstract)

AI总结 QERaman基于Quantum ESPRESSO开发,用于计算共振拉曼光谱,提供开源代码和教程,适用于材料科学研究。

Comments 10 pages, 6 figures, 2 tables

Journal ref Computer Physics Communications, 295, 108967-1-9 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏