arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12227 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4122 篇

2606.06473 2026-06-05 cs.AI cs.CL 62%

MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

MLEvolve:一种用于自动化机器学习算法发现的自我进化框架

Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出MLEvolve框架,通过渐进式MCGS、回溯记忆和分层控制解决LLM智能体在长期任务中的信息隔离、无记忆搜索和缺乏分层控制问题,在MLE-Bench和数学算法优化任务上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05680 2026-06-05 cs.PL cs.AR cs.LG 62%

CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导

Mohammad Akyash, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.LG、cs.PL

AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。

Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14792 2026-06-05 cs.AI cs.SE 62%

IaC Generation with LLMs: An Error Taxonomy and A Study on Configuration Knowledge Injection

利用LLM生成IaC:错误分类法与配置知识注入研究

Roman Nekrasov, Stefano Fossati, Indika Kumara, Damian Andrew Tamburri, Willem-Jan van den Heuvel

机构 * Jheronimus Academy of Data Science(Jheronimus数据科学学院) Tilburg University(蒂尔堡大学) Eindhoven University of Technology(埃因霍温理工大学) University of Sannio(萨诺尼大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨了如何通过系统性地注入结构化配置知识来提高LLM生成正确且意图一致的基础设施即代码(IaC)能力,特别是在Terraform中,提出了新的错误分类法,并评估了多种知识注入技术。

Comments Submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20613 2026-06-05 cs.LG cs.AI cs.MA 62%

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现

Panayiotis Danassis, Naman Goel

机构 * University of Southampton(苏塞克斯大学) University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI 62%

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04246 2026-06-04 cs.AI cs.AR cs.CL 62%

StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis

StepPRM-RTL:基于逐步过程奖励引导的LLM微调以增强RTL综合

Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Ehsan Degan, Vandana Mukherjee

机构 * IBM Research San Jose CA USA(IBM研究院圣何塞加州美国)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出StepPRM-RTL框架,结合逐步轨迹建模、过程奖励模型和检索增强微调,通过密集反馈和蒙特卡洛树搜索探索推理路径,提升LLM生成RTL代码的功能正确性和推理保真度,在基准数据集上相比先前方法提升超10%。

Comments 6 pages, 2 figures, DAC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04023 2026-06-04 cs.SE cs.AI 62%

CodegenBench: Can LLMs Write Efficient Code Across Architectures?

CodegenBench: 大型语言模型能否跨架构编写高效代码?

Jie Li, Wenzhao Wu, Junqi Hu, Qinrui Zheng, Bowen Wu, Juepeng Zheng, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) National Supercomputing Center in Wuxi(无锡国家超级计算机中心) National Supercomputing Center in Shenzhen(深圳国家超级计算机中心) University of the Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出CodegenBench基准测试,评估LLMs在x86_64、Sunway和Kunpeng三种架构上生成高效并行代码的能力,发现其在通用架构上表现良好,但在领域特定架构上性能显著下降。

Comments 29 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI 62%

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02398 2026-06-02 cs.LG cs.CL 62%

A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

跨域干扰与恢复的局部微扰理论:多领域强化学习

Lei Yang, Siyu Ding, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院TJUNLP实验室) Baidu Inc.(百度公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 针对多领域RL训练中一个领域性能下降的问题,提出局部微扰理论,证明后期领域训练主要通过二阶损伤项在低维共享冲突子空间中损害早期领域,并通过短时领域刷新实现选择性恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 62%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 62%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08721 2026-06-01 cs.AR cs.LG cs.SE 62%

KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware

KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试

Jiayi Nie, Haoran Wu, Yao Lai, Zeyu Cao, Cheng Zhang, Binglei Lou, Erwei Wang, Jianyi Cheng, Timothy M. Jones, Robert Mullins, Rika Antonova, Yiren Zhao

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15859 2026-06-01 cs.CL cs.AI 62%

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training

InfiMed-ORBIT: 通过基于评分标准的增量训练使大语言模型对齐开放复杂任务

Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系) Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出ORBIT框架,利用动态生成的病例条件评分标准指导增量强化学习,仅用2k样本将Qwen3-4B-Instruct在HealthBench-Hard上的得分从7.0提升至27.5,达到同规模开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19463 2026-06-01 cs.SE cs.AI 62%

Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems

理解检索增强生成系统的基本设计决策

Shengming Zhao, Yuchen Shao, Yuheng Huang, Jiayang Song, Zhijie Wang, Chengcheng Wan, Lei Ma

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学理工学院) Concordia University(Concordia大学) University of Alberta(阿尔伯塔大学) The University of Tokyo, Japan(日本东京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过系统实验,研究了RAG部署中的三个关键决策(是否部署、检索量、知识集成方式),揭示了任务和模型依赖的优化策略,为实践者提供基于证据的指导。

Journal ref ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22139 2026-05-29 cs.CL cs.AI 62%

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

边推理边提问:将推理型大语言模型从被动求解者转变为主动询问者

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Texas, Dallas(德克萨斯大学达拉斯分校) University of Minnesota(明尼苏达大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出主动交互推理(PIR)范式,通过不确定性感知微调和用户模拟器策略优化,使LLM在推理中主动提问以澄清前提和意图不确定性,在数学推理、代码生成和文档编辑任务上显著提升准确率、通过率和BLEU值,同时减少近半推理计算和不必要交互。

Comments ACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29822 2026-05-29 cs.SE cs.AI 62%

Inferring Code Correctness from Specification

从规约推断代码正确性

Tambon Florian, Papadakis Mike

机构 * University of Luxembourg(卢森堡大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出TRAILS方法,通过基于规约的类别划分生成测试输入并执行,利用LLM评估输入输出对是否符合规约,从而推断代码正确性,在LiveCodeBench和CoCoClaNeL数据集上相比基线方法提升了马修斯相关系数并增强了稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23234 2026-05-29 cs.AI cs.LG 62%

MemCollab: Cross-Model Memory Collaboration via Contrastive Trajectory Distillation

MemCollab:通过对比轨迹蒸馏实现跨模型记忆协作

Yurui Chang, Yiran Wu, Qingyun Wu, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) AG2AI

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对不同骨干模型代理间共享记忆性能下降的问题,提出MemCollab框架,通过对比同一任务上不同模型生成的推理轨迹来蒸馏共享的抽象推理约束,并引入任务感知检索机制,提升异构代理的准确性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28258 2026-05-28 cs.SE cs.AI cs.CV cs.HC 62%

GUI Agents for Continual Game Generation

面向持续游戏生成的GUI智能体

Yixu Huang, Bo Li, Na Li, Zhe Wang, Kaijie Chen, Haonan Ge, Qingyi Si, Yuanzhe Shen, Ruihan Yang, Guangjing Wang, Hongcheng Guo

机构 * Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司) Tongji University(同济大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出利用GUI智能体作为客观评估者和主观测试者,通过PlaytestArena和Play2Code框架实现持续游戏生成,显著提升可玩性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 62%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01745 2026-05-28 cs.LG cs.AI 62%

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

概率-熵校准:一种用于自适应微调的弹性指标

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出概率-熵校准信号(相对排名指标)进行token级重加权,以平衡预训练先验与下游对齐,在数学推理、分布外推理和代码生成任务上优于仅基于概率或熵的方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26842 2026-05-27 cs.LG cs.CL 62%

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

MONA: 基于Nesterov加速的Muon优化器用于可扩展语言模型训练

Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出MONA优化器,通过将Nesterov加速项集成到Muon的梯度处理流程中,实现曲率感知加速,从而帮助逃离尖锐局部最小值,并在1B到68B参数的混合专家预训练中取得更优收敛和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26646 2026-05-27 cs.AI cs.CL cs.MA 62%

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25338 2026-05-26 cs.LG cs.AI 62%

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

CausalFlow: LLM Agent 失败的因果归因与反事实修复

Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出CausalFlow框架,通过反事实干预计算步骤级因果责任分数,识别失败步骤并生成最小编辑修复,用于测试时修复和训练时监督,在多个基准上优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17937 2026-05-26 cs.CL cs.AI 62%

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench:面向自动化量化策略回测的大语言模型基准测试

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

机构 * Beijing Normal University(北京师范大学) Elmleaf Ltd.(Elmleaf公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出首个大规模自动化量化回测基准BacktestBench,包含18,246个问答对,并设计多智能体基线AutoBacktest,通过协调摘要器、检索器和编码器实现自然语言策略到可重复回测的转换。

Comments This paper has been accepted by KDD 2026 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25232 2026-05-26 cs.SE cs.AI cs.LO 62%

Specification-Based Code-Text-Code Reengineering for LLM-Mediated Software Evolution

基于规约的代码-文本-代码重构:面向LLM介导的软件演化

Oleg Grynets, Vasyl Lyashkevych, Arsen Dolichnyi, Roman Piznak, Taras Zelenyy, Volodymyr Morozov

机构 * EPAM Systems(EPAM系统) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩) Lviv, Ukraine(乌克兰利沃夫) Kyiv, Ukraine(乌克兰基辅)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出一种基于规约的Code2Text2Code重构框架,通过将源代码转换为中性文本规约并迭代验证,解决直接Code2Code转换中的语义漂移、行为变化等问题,实现受控的LLM介导软件演化。

Comments 15 pages, 9 figures, 7 tables, 39 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24697 2026-05-26 cs.CL cs.AI 62%

The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models

路径很重要:学习扩散语言模型的令牌提交策略

Bohang Sun, Max Zhu, Francesco Caso, Jindong Gu, Junchi Yu, Philip Torr, Pietro Liò, Jialin Yu

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13323 2026-05-26 cs.AI cs.LG 62%

Error-Driven Prompt Optimization for Arithmetic Reasoning

基于错误驱动的算术推理提示优化

Árpád Pándy, Róbert Lakatos, András Hajdu

机构 * Deptartment of Data Science & Visualization, Faculty of Informatics, University of Debrecen(数据科学与可视化系,信息学院,德布勒恩大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出一种错误驱动的提示优化框架,通过聚类错误预测迭代优化提示规则,使小型本地语言模型在算术推理任务中准确率达到70.8%,超越GPT-3.5 Turbo。

Journal ref IEEE Access, vol. 14, pp. 62570-62583, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23966 2026-05-26 cs.CL cs.AI cs.SY eess.SY math.CO 62%

TriVAL: A Tri-Validation Framework for Faithful Automatic Optimization Modeling

TriVAL: 一种用于忠实自动优化建模的三重验证框架

Ziyang Fang, JinXi Wang, Jinghui Zhong, Yew-Soon Ong

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出TriVAL三重验证框架,在语义规范、数学公式和代码生成三个阶段进行显式验证,通过构建-验证-修正循环提高自动优化建模的准确性,并在新基准NL4COP上超越现有方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01576 2026-05-26 cs.LG cs.AI cs.CV 62%

Generative Visual Code Mobile World Models

生成式视觉代码移动世界模型

Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

机构 * Trillion Labs(万亿实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出通过单一视觉语言模型预测可执行网页代码来生成移动GUI下一状态,结合文本和视觉世界模型优势,实现高保真视觉生成与精确文本渲染。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23543 2026-05-25 cs.PL cs.SE 62%

JEDI: Java Evaluation of Declarative and Imperative Queries

JEDI: Java声明式与命令式查询评估

Filippo Schiavio, Walter Binder

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 提出JEDI基准测试套件,通过自动将SQL基准转换为Java基准,分析Stream API与命令式实现的性能差异,以指导开发者优化代码。

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE '26)

详情

展开后加载摘要…

URL PDF HTML 收藏