arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 284 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 284 篇

2606.25102 2026-06-25 cs.CL 新提交 57%

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22830 2026-06-23 cs.AI 新提交 57%

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

寻找证据:发现决策支持令牌以进行在线策略推理蒸馏

Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

机构 * Meituan Longcat Team(美团Longcat团队) Nanjing University(南京大学) TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部TJUNLP实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出DEAR方法,通过学生熵识别决策点,利用隐状态余弦相似性和师生差异发现证据令牌,在数学和代码基准上提升推理蒸馏效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21401 2026-06-23 cs.DC cs.AI 新提交 57%

SwarmX: Agentic Scheduling for Low-Latency Agentic Systems

SwarmX: 面向低延迟智能体系统的智能调度

Yeqi Huang, Yanwei Ye, Guomin Chen, Wenhao Su, Bin Gong, Jialian Li, Zhan Lu, Yangshen Deng, Xuan Sun, Le Xu, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Tencent(腾讯)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出SwarmX系统,通过调度专用神经预测器捕获提示、设备、运行时和目标模型特征,结合路由器与缩放器实现尾延迟感知决策,在近千GPU和百万CPU核的生产部署中,相比现有调度器将尾延迟降低61.5%,吞吐量提升2倍。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20711 2026-06-23 cs.CV cs.AI 新提交 57%

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code: 通过动作感知重访从UI视频生成交互式网页

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

机构 * University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) Zhipu AI(智谱AI) Beihang University(北京航空航天大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。

Comments 31 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22859 2026-06-23 cs.AI astro-ph.IM physics.soc-ph 新提交 57%

AI Scientists as Engines of Discovery: A Case for Development within Reformed Institutions

作为发现引擎的AI科学家:在改革机构内发展的案例

Raul Jimenez, Boris Bolliet, Francisco Villaescusa-Navarro, Rabih Zbib, Benjamin Wandelt, David N. Spergel, Thomas Meier, Jessica Montgomery, Hana Aliee, Licia Verde

机构 * Institute of Cosmos Sciences (ICCUB), University of Barcelona(巴塞罗那大学宇宙科学研究所) ICREA Cavendish Astrophysics, University of Cambridge(剑桥大学卡文迪什天体物理学) Kavli Institute for Cosmology, University of Cambridge(剑桥大学卡维里宇宙学研究所) Center for Computational Astrophysics, Flatiron Institute(弗拉蒂隆研究所计算天体物理中心) Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理科学系) Avature Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学物理与天文学系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Flatiron Institute(弗拉蒂隆研究所) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) School of Clinical Medicine, University of Cambridge(剑桥大学临床医学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文论证多智能体AI系统将从被动工具进化为“AI科学家”,通过原型框架Denario加速发现周期,并提出机构需为验证、问责、可解释性和双重用途安全进行改革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17999 2026-06-23 cs.CL 新提交 57%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19644 2026-06-19 cs.SE 新提交 57%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18747 2026-06-18 cs.RO cs.AI 新提交 57%

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

通过基于人类反馈的迭代强化学习利用大语言模型生成自然且富有表现力的机器人手势

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

机构 * University of New South Wales(新南威尔士大学) Universidad Central de Chile(智利中央大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对社交机器人手势生成僵硬问题,提出将ChatGPT集成到Pepper机器人中生成共语手势,并引入基于人类反馈的迭代强化学习(RLHF)优化手势,实验表明RLHF提升了手势的表现力、相关性和流畅性。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17696 2026-06-17 cs.AI cs.GR 新提交 57%

FllumaOne: A Code-Native Multimodal CAD Dataset with Executable Programs and Kernel-Validated Feature Histories

FllumaOne:一个代码原生多模态CAD数据集,包含可执行程序与内核验证的特征历史

Jizong Zhan

机构 * Qt/C++ OpenCASCADE-based CAD system(基于Qt/C++ OpenCASCADE的CAD系统)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 提出FllumaOne数据集,通过可执行Python程序生成CAD模型,对齐程序、特征树、几何等模态,支持可编辑逆向工程等任务。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16162 2026-06-16 cs.SE 新提交 57%

Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement

基于反馈驱动多轮精化的二进制反编译大语言模型

Peipei Liu, Jian Sun, Mingzhe Xing, Yicheng Zeng, Zhaoteng Yan, Lixiao Zhang, Li Chen, Dan Li

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出AutoDecompiler,利用强化学习进行反馈驱动的多轮二进制反编译,通过编译、执行和I/O测试反馈迭代改进代码,显著提升行为可重执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15500 2026-06-16 cs.AR cs.AI cs.SY eess.SY 新提交 57%

LLM4RTL: Tool-Assisted LLM for RTL Generation

LLM4RTL: 工具辅助的大语言模型用于RTL生成

Jing Jin, Robert Chu, Ning Yan, Masood S. Mortazavi

机构 * UC Riverside(加州大学河滨分校) Futurewei(未来科技)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出JRCRC流水线,利用商业LLM层次结构过滤和优化RTL代码生成数据集,并设计工具辅助架构提升逻辑推理能力,在VerilogEval上超越多数方法,用更小模型达到GPT-4O性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15453 2026-06-16 cs.AR cs.LG 新提交 57%

A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

面向高效MoE大语言模型推理的时空专家预取框架

Yingnan Zhao, Razvan Bunescu, Ahmed Louri, Avinash Karanth, Ke Wang

机构 * George Washington University(乔治华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Ohio University(俄亥俄大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 针对MoE大模型推理中专家加载延迟问题,通过分析专家选择行为的时空相关性,提出ST-MoE框架,结合轻量级运行时预测和可重构硬件设计,实现专家预取以重叠计算与加载,提升性能与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15074 2026-06-16 cs.LG 新提交 57%

TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

TriAdReview: 用于多模型技术文档生成的三角对抗审查架构

Zhiqiang Zhou, Junliang Dai, Xu Ling

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出TriAdReview三角对抗审查架构,使用两个独立审查模型和三角判断机制迭代改进生成器输出,在五个基准任务上相比单模型基线提升10.1%,但发现对抗审查在完整性任务上存在结构偏差。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14998 2026-06-16 cs.PL 新提交 57%

Rumoca: Modelica as a Universal Algebraic Frontend via a Rust-Native Compiler

Rumoca:通过Rust原生编译器将Modelica作为通用代数前端

Micah K. Condie, Abigaile Woodbury, Thomas Meschede, Joel A. E. Andersson, James M. Goppert

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 提出Rust原生Modelica编译器Rumoca,通过显式阶段边界和模板驱动代码生成,将Modelica转换为多种工具的通用代数前端,支持实时软件在环仿真,并实现零安装运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13982 2026-06-15 stat.ML cs.LG 新提交 57%

Adaptive Nucleus Truncation for Long-Form Reasoning

自适应核截断用于长形式推理

Ousmane Amadou Dia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出自适应核截断采样(ANTS),通过熵条件控制器动态调整截断宽度,在长文本生成中提升推理性能,在33B参数稀疏MoE模型上平均提升1.9-5.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13380 2026-06-12 quant-ph cs.AI 新提交 57%

An LLM System for Autonomous Variational Quantum Circuit Design

用于自主变分量子电路设计的大语言模型系统

Kenya Sakka, Wataru Mizukami, Kosuke Mitarai

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) The University of Osaka(大阪大学) Graduate School of Engineering Science(工学研究科)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的自主代理框架,通过迭代设计量子电路,在量子特征映射和变分量子本征求解器任务中取得优于或媲美现有方法的性能。

Comments 63 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11521 2026-06-11 cs.LG 新提交 57%

Counterexample Guided Learning in the Large using Reasoning Agents

使用推理代理的大规模反例引导学习

Hongyi Liu, Frederic Sala, Thomas Reps, Adithya Murali

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 代码生成 :program synthesis(abstract);分类 cs.LG

AI总结 提出反例引导的LLM正则表达式归纳框架,通过验证器反馈和代理策略(如反思与修复循环)显著提升样本效率和复杂任务成功率。

Comments Code, data, and resources are publicly available for research purposes: https://github.com/Lhtie/CEGML

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10945 2026-06-10 cs.CR cs.SE 新提交 57%

Context-Based Adversarial Attacks on AI Code Generators: Vulnerability Analysis and Implications

基于上下文的AI代码生成器对抗攻击:漏洞分析与影响

Walther A. Del Orbe, John D. Hastings, Varghese Vaidyan

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究通过2800次实验,发现上下文对抗攻击使代码生成漏洞增加10.7倍,并提出双层防御框架实现89.1%检测率。

Comments 6 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10752 2026-06-10 cs.AI 新提交 57%

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE: 通过显式表示的求解器策略实现可靠的智能体PDE求解

Huanshuo Dong, Keyao Zhang, Hong Wang, Zhezheng Hao, Zhiwei Zhuang, Ziyan Liu, Jiacong Wang, Gengyuan Liu, Xin Jin

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) University of the Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 代码生成 :coding agent(abstract);分类 cs.AI

AI总结 提出AutoPDE,一种将求解器策略作为显式对象维护的代码智能体,通过PDE分析、数值方法选择和自适应调优三阶段构建策略,在PDE Agent Bench上达到54.5%的通过率,比最强基线提升14.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 57%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09885 2026-06-10 cs.LG stat.ML 新提交 57%

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP:用于混合专家的梯形专家神经元剪枝

Jiangyang He, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院 TJUNLP实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出TENP框架,通过识别重要专家并对其余专家进行神经元剪枝,保留梯形参数模式,在40%路由专家稀疏度和平均63.76%激活参数下,DeepSeek模型准确率仅下降1点,代码生成任务提升10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 57%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-06-09 cs.AI physics.flu-dyn 新提交 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07968 2026-06-09 cs.CR cs.AI 新提交 57%

RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks

RecurGuard: 推理令牌消耗攻击的运行时监控

Abid Aziz, Hafsa Binte Kibria

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Rajshahi University of Engineering & Technology(拉贾克西希大学工程与技术学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 RecurGuard通过监控推理轨迹的重复率、体积增长和查询进展三个信号,实时检测并阻止推理令牌消耗攻击,在DS-R1-Qwen-7B上对OverThink和ExtendAttack的检测率分别达99%和92%,且误报率接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06843 2026-06-08 cs.SE 新提交 57%

Empirical Study on the Characteristics and Evolution of AI-usage in GitHub Repositories: Evidence from Code Comments

GitHub仓库中AI使用特征与演化的实证研究:来自代码注释的证据

Abdullah Al Mujahid, Preetha Chatterjee, Mia Mohammad Imran

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 通过分析35,361条提及AI的GitHub代码注释及后续提交,发现开发者主要用LLM实现代码,随后频繁重构、集成和修复,AI引用从代码生成转向知识支持和代码增强。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16484 2026-08-18 cs.CV 新提交 50%

Remote-Sensing City Layout Extraction with MLLM

基于多模态大语言模型(MLLM)的遥感城市布局提取

Zigan Zhou, Kai Li, Yupeng Deng

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute(空天信息创新研究院)

专题命中 代码生成 :code generation(abstract)

AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。

Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13122 2026-08-14 cs.DC 新提交 50%

Validation-Centric AI-Assisted GPU Porting of a 250,000+ Line Legacy Weather Simulation Code

面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植

Tetsuya Hoshino, Masaya Kato, Kazuhisa Tsuboki, Daichi Mukunoki, Takahiro Katagiri, Toshihiro Hanawa

专题命中 代码生成 :code generation(abstract)

AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。

Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 50%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 代码生成 :code generation(abstract)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04450 2026-08-06 cs.DC 新提交 50%

CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?

CommBench:大语言模型能编写正确且高效的GPU通信代码吗?

Shuang Ma, Yuyi Li, Yihan Zhang, Hezhi Xie, Danyang Chen, Shuyang Ji, Ziming Mao, Cheng Ji, Ansha Prashanth, Wenting Yang, Yiran Wang, Chihan Cui, Pei Yu Lin, Ion Stoica, Yang Zhou

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出GPU通信编程综合基准CommBench,评估发现最强代码生成模型GPT-5.5仅在30.7%任务中实现正确高效的GPU通信代码,凸显LLMs与专家水平的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏