Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation
面向Verilog代码生成的执行锚定幻觉校准重排序
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
面向Verilog代码生成的执行锚定幻觉校准重排序
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。
巨头基准测试:.NET生态系统中LLM代码生成质量的多维度实证评估
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出自动化多维度评估框架,针对C#代码生成评估GPT等四个LLM,发现Pass@k排名无法反映LLM在软件工程场景的完整性能概况,还明确了GPT的双峰失败行为。
Comments 12 pages, 8 figures. Accepted at the Second Workshop on Large Language Models for Generative Software Engineering (LLM4SE 2026), co-located with STAF 2026, Rennes, France, June 29 - July 3, 2026
评估针对大语言模型生成代码中包幻觉的推理时防御措施
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。
Comments Accepted ASE 2026
SLICE:规约级别的契约执行隔离
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL
AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。
Comments 17 pages, 6 figures, 3 tables
LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因
机构 * EvoMap ; Tsinghua University(清华大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL
AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。
面向地热井阵列的大型语言模型决策支持与建模
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。
Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025
基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议
机构 * Chalmers University of Technology(查尔姆斯理工大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。
Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026
SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。
架构作为编码智能体的能力均衡器
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。
探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 软件智能体 :software agent(title);repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。
GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Lightspeed Studios, Tencent(腾讯光速工作室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI
AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。
代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。
Comments 38 pages, 8 figures
SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。
编码智能体能构建鲁棒基线吗?一种基于技能的医学影像模型开发流水线自动化方法
机构 * Arionkoder LLC(阿里昂科德有限责任公司) ; Yatiris(亚蒂里斯) ; UNICEN-CONICET(国立中央大学-阿根廷国家科学技术研究委员会)
专题命中 软件智能体 :coding agent(title);code generation(abstract)
AI总结 该研究提出一种结合文献引导推理等的智能体式AI科学家工作流,可自动化医学影像模型开发流水线,在四个公开基准上取得竞争力结果,大幅降低相关工程工作量。
Comments MICCAI 2026 Workshop AgenticMed
TessIndex:面向智能体经济的能力验证身份系统
机构 * University of Oxford(牛津大学) ; Indian Institute of Technology, Delhi(印度理工学院德里分校)
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 针对智能体经济基础设施的三大缺陷,提出采用双平面架构的TessIndex系统,实现智能体原语的持久身份、可验证能力声明及价值捕获,为智能体经济提供集成化身份支撑。
XRFix:利用大语言模型探索扩展现实应用的性能缺陷修复
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 该研究针对XR应用性能缺陷修复的技术挑战,提出基于大语言模型的XRFix框架,构建缺陷数据集与定制检测工具,经实验验证其修复性能优于SOTA APR方法。
通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成
机构 * University of Innsbruck(因斯布鲁克大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TRIAD三阶段自动化多跳RAG评估数据集生成方法,经与MuSiQue、HotpotQA对比验证,该生成数据集可有效评估特定领域RAG系统性能,相关代码与验证结果已公开。
Comments Accepted at the 19th International Natural Language Generation Conference (INLG 2026)
星际争霸II中AlphaStar的AI控制之运行时动作干预
机构 * University of New South Wales(新南威尔士大学) ; CSIRO(澳大利亚联邦科学与工业研究组织)
专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出运行时动作干预(RAI)机制,将其应用于AlphaStar复现版并开展《星际争霸II》人类实验,发现向用户披露AI对手能力会显著影响人类对其公平性、毒性的感知,需将执行栈控制与能力披露分开评估。
Repo2Skill-Evo:仓库技能在静默中过时
机构 * ByteDance(字节跳动) ; Peking University(北京大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI
AI总结 Repo2Skill-Evo研究发现,在57个真实仓库的105次版本转换中,前沿智能体难以可靠维护仓库技能,其平均@3 macro F1仅29.9%-69.7%,仓库技能会在无明确信号的情况下静默过时。
GUI元素定位中的词汇耦合:句子嵌入追踪移动端与网页的标签
机构 * University of Helsinki(赫尔辛基大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对GUI定位评估中嵌入相似度与语义定位的混淆问题,对比编码器与词汇基线,提出需报告词汇基线等诊断指标以区分标签恢复与语义定位。
智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查
专题命中 仓库级理解 :repository(abstract);分类 cs.PL
AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。
Comments 24 pages
带有快速写入路由与慢速整合的双层智能体记忆
机构 * Zhejiang University(浙江大学) ; Xiaohongshu(小红书) ; University of North Texas(北得克萨斯大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。
科学数据集的多智能体发现与资源感知自主探索
专题命中 仓库级理解 :repository(abstract);分类 cs.AI
AI总结 针对单个研究者难以发现探索大规模科学数据集的问题,提出WebVisus多智能体系统,可基于自然语言问题启动自主智能体,适配资源探索数据集并完成案例验证。
Comments 10 pages, 4 figures, 1 table. To appear in 2026 IEEE eScience Proceedings
循环工程:构建模块、采用情况及影响
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。
Comments 10 pages, 2 tables, under review
ROS2SmolVLA:适用于集成到工业级轻量机器人的小型视觉-语言-动作模型
机构 * University of Augsburg(奥格斯堡大学)
专题命中 仓库级理解 :repository(abstract)
AI总结 本研究将SmolVLA适配于Universal Robots轻量机器人,发布ROS2SmolVLA开源接口,通过UR10e取放任务验证其功能,为工业级轻量机器人提供了本地可计算的小型VLA模型方案。
Comments Accepted at 8th International Conference on Industry of the Future and Smart Manufacturing, Padua & Venice, 2026
神经形式化验证:智能体的语言无关形式化程序推理
专题命中 程序分析与验证 :coding agent(abstract);分类 cs.SE、cs.PL
AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。
VeGo:面向计算机科学教育的Go程序直接演绎形式化验证
专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL
AI总结 该研究提出面向计算机科学教育的VeGo系统,可直接验证标准Go程序,整合多种形式化验证技术,对比其他语言论证Go的优势,经教育教材评估并规划了形式并发规约的路线图。
Comments 13 pages + 2 pages of references, 5 code displays, ancillary reference manual for VeGo
利用上下文学习预测漏洞严重性:一项工业案例研究
专题命中 其他AI编程 :code model(abstract);分类 cs.AI
AI总结 本研究通过工业案例,用可本地部署的开源LLM的上下文学习从C/C++代码片段预测CVSS v3.1评分,发现CodeLlama2-7B在轻量输出约束提示下可接近云服务性能,且Big-Vul可作为工业数据代理。
Comments 11 pages, 6 figures