Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches
软件任务中强化学习的奖励工程
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。
Comments Accepted at EMNLP 2026 (Findings)
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
软件任务中强化学习的奖励工程
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。
Comments Accepted at EMNLP 2026 (Findings)
TESTNAV:面向组合鲁棒性测试的帕累托引导搜索
机构 * Northeastern University London(伦敦东北大学) ; University of Kent(肯特大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 TESTNAV是帕累托引导的鲁棒性测试框架,采用NSGA-II近似双目标帕累托前沿,在四类跨模态基准上,以35.8%-89.3%的扰动空间实现比基线快2.15倍的帕累托前沿恢复。
面向物联网汽车应用的全自动、感知部署的测试流水线
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。
Comments Submitted, accepted and presented at IoTBDS26
作为检测器的大语言模型:一种用于表格异常检测的上下文学习方法
机构 * Applied Artificial Intelligence Initiative (A2I2), Deakin University(应用人工智能计划(A2I2),迪肯大学) ; Adelaide University(阿德莱德大学) ; Monash University(莫纳什大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本研究提出LLM-Detector框架,利用LLM的上下文学习能力进行表格异常检测,在24个数据集上对比15个SOTA基线均获提升,且无需微调或神经网络训练,降低了计算成本。
Comments Accepted at International Conference on Neural Information Processing (ICONIP) 2026
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 代码生成 :code generation(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
面向纳米光子学的大语言模型综合综述:从代理建模到自主设计
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Tennessee at Chattanooga(田纳西大学查塔努加分校)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。
Comments Accepted for publication in Advanced Photonics
r2py:用于AI辅助将R统计包转换为Python的框架
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。
Comments v2: substantially extended. Adds a second case study (rpart) reached through R's .Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened
GxP-Agent:基于流程有向无环图拓扑结构的可靠临床试验编程大模型智能体
机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究提出基于流程DAG拓扑的多智能体系统GxP-Agent,在临床试验编程任务上显著优于现有方法,实现了高结构匹配率,验证了编码领域流程知识为图拓扑的有效性。
Comments Preprint. 9 pages main text, 3 figures, plus references and appendix
开源统一瞬态多相先进反应堆模拟工具包(Outram Park)中库的智能体迁移、构建及初步验证与确认 第一部分:热工水力
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究将OpenFOAM库智能体迁移至Rust语言的Outram-Foam库,开发了两相HEM壅塞流求解器,验证显示其吻合度良好,智能体编码可提升开源库开发效率,人类专业知识仍为关键。
Comments 78 pages, 21 figures, 17 tables
从张量加速器ISA描述自动生成ML编译器后端
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本文提出ACT工具,可基于ISA描述自动生成张量加速器的XLA编译器后端,其生成的后端性能优于商用编译器,且提升了AWS Trainium的代码生成覆盖率。
Comments Accepted at OOPSLA 2026
比较 vibe 编码工具生成代码的质量
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。
基于LLMs菜单的智能体进化,在每个价格点展开竞争
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。
利用影响函数检测受污染的代码生成提示批次
机构 * The University of Oxford(牛津大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。
洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动
机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。
Comments Accepted at the Conference on Language Modeling (COLM) 2026
当LLM发明Rust包:幻觉模式与缓解措施的实证研究
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究首次大规模实证分析LLM生成Rust代码中的包幻觉问题,发现不同模型幻觉率惊人一致且对参数不敏感,并探索了提示工程缓解策略。
Comments The work has been accepted by the 17th International Conference on Internetware
语义分化用于解决水印标记低熵约束生成输出的挑战
机构 * School of Interactive Computing(交互计算学院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 SeqMark通过语义分化解决低熵约束生成任务中水印标记的挑战,提升检测准确率并保持生成质量。
Comments 23 pages, 5 figures, COLM 2026
StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。
Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026
从视觉控件到UI代码:高效的基于工具的生成
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; Concordia University(康考迪亚大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能
Comments ECCV2026 (MUCG Workshop)
它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。
用于MTIA的Triton:弥合定制AI加速器的编程模型差距
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。
Comments 12 pages, 12 figures, to be published in IEEE Micro
在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。
Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal
激活探针:挖掘模型输出遗漏的表面代码安全信号
专题命中 代码生成 :coding agent(abstract);分类 cs.LG
AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。
Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026
改进型^2环境分类器
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本文针对带可变状态的MetaML风格多阶段编程,提出改进型环境分类器类型系统,排除有害作用域外溢,实现多级代码生成等功能,在Rocq中完成实现与机械化证明。
从接口到推理:从任意阶模型中引出任意阶推理
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 该研究针对离散推理任务的任意阶推理需求,提出两种掩码扩散改进方法,训练对应模型验证了方法可诱导任意阶推理行为并提升下游性能。
RankGuide: 张量秩引导的路由与引导以实现高效的推理
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Intel Labs(英特尔实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。
在LLM推理扩展中采样多样性的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; The Chinese University of Hong Kong(香港中文大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; NEC Laboratories America(NEC美国实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。
Comments 31 pages
推理如何塑造大语言模型生成代码中的社会偏见?
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。
Comments ASE 2026
基于大语言模型的符号图形编程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 代码生成 :program synthesis(abstract);分类 cs.LG
AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。
Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
AgentExecutor:基于智能体上下文生成的部分代码执行工具
专题命中 代码生成 :program synthesis(abstract);分类 cs.SE
AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。
Comments ASE 2026
探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。