Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation
面向Verilog代码生成的执行锚定幻觉校准重排序
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
面向Verilog代码生成的执行锚定幻觉校准重排序
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。
巨头基准测试:.NET生态系统中LLM代码生成质量的多维度实证评估
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出自动化多维度评估框架,针对C#代码生成评估GPT等四个LLM,发现Pass@k排名无法反映LLM在软件工程场景的完整性能概况,还明确了GPT的双峰失败行为。
Comments 12 pages, 8 figures. Accepted at the Second Workshop on Large Language Models for Generative Software Engineering (LLM4SE 2026), co-located with STAF 2026, Rennes, France, June 29 - July 3, 2026
利用多模态大语言模型探索程序流程图在代码生成中的潜力
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。
Comments 21 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Regular Papers Track
VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成
机构 * Meituan(美团)
专题命中 代码生成 :code generation(title,abstract)
AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。
Comments Accepted by EMNLP 2026 Main
评估针对大语言模型生成代码中包幻觉的推理时防御措施
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。
Comments Accepted ASE 2026
SLICE:规约级别的契约执行隔离
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL
AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。
Comments 17 pages, 6 figures, 3 tables
MOSAIC:结构化智能体智能与组合的模块化编排
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) ; University College London(伦敦大学学院) ; University of Edinburgh(爱丁堡大学) ; Data & Analytics, Digital X(Digital X 数据与分析部) ; Alan Turing Institute(艾伦·图灵研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。
LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因
机构 * EvoMap ; Tsinghua University(清华大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL
AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。
面向地热井阵列的大型语言模型决策支持与建模
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。
Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025
基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议
机构 * Chalmers University of Technology(查尔姆斯理工大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。
Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026
用领域特定语言改进神经偏微分方程求解器的自动设计
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。
自进化科学智能体发现可泛化的物理推理流体控制
机构 * National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。
SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。
架构作为编码智能体的能力均衡器
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。
探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 软件智能体 :software agent(title);repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。
GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Lightspeed Studios, Tencent(腾讯光速工作室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI
AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。
代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。
Comments 38 pages, 8 figures
SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。
SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。
编码智能体能构建鲁棒基线吗?一种基于技能的医学影像模型开发流水线自动化方法
机构 * Arionkoder LLC(阿里昂科德有限责任公司) ; Yatiris(亚蒂里斯) ; UNICEN-CONICET(国立中央大学-阿根廷国家科学技术研究委员会)
专题命中 软件智能体 :coding agent(title);code generation(abstract)
AI总结 该研究提出一种结合文献引导推理等的智能体式AI科学家工作流,可自动化医学影像模型开发流水线,在四个公开基准上取得竞争力结果,大幅降低相关工程工作量。
Comments MICCAI 2026 Workshop AgenticMed
提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试
机构 * PointFive
专题命中 软件智能体 :coding agent(title);分类 cs.CL
AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。
TessIndex:面向智能体经济的能力验证身份系统
机构 * University of Oxford(牛津大学) ; Indian Institute of Technology, Delhi(印度理工学院德里分校)
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 针对智能体经济基础设施的三大缺陷,提出采用双平面架构的TessIndex系统,实现智能体原语的持久身份、可验证能力声明及价值捕获,为智能体经济提供集成化身份支撑。
代理程序修复中的动态共生测试生成
机构 * Google, USA(谷歌(美国))
专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI
AI总结 本文研究了在程序修复中动态共生生成测试的方法,通过在同一补丁中生成修复和测试用例,提高修复的可信度并减少维护成本。
XRFix:利用大语言模型探索扩展现实应用的性能缺陷修复
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 该研究针对XR应用性能缺陷修复的技术挑战,提出基于大语言模型的XRFix框架,构建缺陷数据集与定制检测工具,经实验验证其修复性能优于SOTA APR方法。
基于LLM的Java无模拟单元测试生成
专题命中 测试生成 :unit test generation(title,abstract);code generation(abstract);分类 cs.SE
AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026
玻尔兹曼MapReduce:可分叉沙盒的配分函数归约
机构 * Incredibuild(Incredibuild公司) ; HIT CS Department(以色列理工学院计算机科学系)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 研究在局部渐近正态性下工作节点发出的置信密度,指出其为吉布斯 - 玻尔兹曼测度,逆温度是样本大小。高斯/线性下相关结果精确,MapReduce归约是配分函数,还有频率主义一致性等结论。
Comments N/A
CORE-Bench:智能体编程时代代码检索的综合基准
专题命中 代码评测 :repository(abstract);coding agent(abstract)
AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。
Comments Accepted By EMNLP 2026 Main
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis
Text-ADBench:基于大语言模型嵌入的文本异常检测基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。