From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
从评估到增强:大型语言模型在零知识证明代码生成中的应用
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
从评估到增强:大型语言模型在零知识证明代码生成中的应用
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。
AutoCodeSherpa: AI 编程代理中的符号解释
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 AutoCodeSherpa通过符号公式提供软件问题解释,提升自动化修复和程序分析的准确性与可靠性。
编码代理是否生成过度的模拟测试?一项实证研究
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文研究了编码代理生成测试中模拟的使用情况,发现代理更倾向于修改测试并添加模拟,同时指出模拟测试可能更容易自动生成但验证效果较弱。
Comments Accepted for publication at MSR 2026
IC-EO: 可解释的基于代码的地球观测助手
机构 * Université Paris Cité, LIPADE, F-75006 Paris, France askEarth AG, Zurich, Switzerland ESA -lab, Frascati, Italy ESA, Advanced Concepts ; Studies Office, Noordwijk, the Netherlands
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 IC-EO提出一个可解释的代码生成助手,通过生成可审计的Python工作流程,提升地球观测分析的透明性和可复现性,优于现有基线模型。
Comments 15 pages, 1 figure
静默贡献:对AI生成的静默拉取请求的洞察
专题命中 软件智能体 :AI agent(abstract);分类 cs.SE
AI总结 研究首次分析了AI生成的静默拉取请求对代码质量和安全的影响,揭示其接受或拒绝的潜在原因。
Comments 5 pages, 4 figures, accepted at MSR Mining Challenge 2026
CHEHAB RL: 学习优化完全同态加密计算
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 CHEHAB RL通过深度强化学习自动优化FHE代码,提升执行速度和减少噪声,编译过程更高效。
通过LLM驱动的语义逻辑重组发现100余项编译器缺陷
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 FeatureFuzz通过语义逻辑重组发现编译器缺陷,有效提升模糊测试的多样性与发现能力。
AI生成拉取请求中早期阶段的审查努力预测
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本研究提出一种基于创建时间的电路断开模型,用于预测AI生成拉取请求的高维护需求,通过静态复杂性线索识别高成本贡献,提升维护效率。
Comments 5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)
Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13-14, 2026, Rio de Janeiro, Brazil
U-Fold:面向用户中心任务的动态意图感知上下文折叠
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Westlake University(西湖大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。
MobileCity: 一种大规模城市行为模拟的高效框架
机构 * Woven by Toyota(丰田公司) ; The University of Tokyo(东京大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 MobileCity通过高效框架模拟真实城市行为,结合多种交通方式和本地模型提升效率,实现更真实的行为生成与应用拓展。
SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径
机构 * HKU STAR Lab(香港大学STAR实验室) ; Google Cloud(谷歌云) ; CUHKSZ(香港中文大学) ; CUHK(香港中文大学) ; THU(清华大学) ; The BIRD Team(BIRD团队)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。
Comments 29 pages, 10 figures, NeurIPS 2025 Main
从LLM到代理:提供编译器对编程的影响
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文研究了提供编译器如何提升LLM在编程任务中的表现,发现编译器能显著提高编译成功率并减少错误,且小型模型在某些情况下表现更优。
自动驾驶?开源软件中人类与AI协作及审查实践的实证研究
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本研究通过分析开源项目中AI辅助PR的互动模式,发现非所有权贡献者提交的AI共同撰写的PR被快速合并且反馈极少,揭示了AI在软件工程中的协作与审查实践问题。
Comments accepted as MSR short paper
将形式方法工具应用于电子战代码库(经验报告)
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文报告了将形式方法工具应用于电子战系统中的经验,探讨了工具可用性及漏洞检测比较,并提出改进建议。
并行解码学习:用于实时量子错误校正的自协调神经网络
机构 * Zhongguancun Laboratory(中关村实验室) ; Pengcheng Laboratory(鹏城实验室)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 本文提出了一种自协调神经网络,用于实时量子错误校正,实现了高精度并行解码,突破了传统解码器的吞吐量瓶颈。
Comments The main text consists of 25 pages and 9 figures, extending our prior work (arXiv:2509.03815) with new results on surface code decoding in superconducting qubit systems and real-time performance benchmarks on TPU v6e
QueryIPI: 针对编码代理的查询无关间接提示注入
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 QueryIPI通过利用系统不变性与工具描述,实现对编码代理的查询无关间接提示注入,实验显示其在模拟代理中达到87%的成功率,揭示了现实中的安全风险。
气味取决于上下文:关于问题跟踪问题和实践中气味的访谈研究
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文通过访谈研究,探讨了问题跟踪系统中问题和气味的上下文依赖性,揭示了团队在实际工作中遇到的挑战及潜在的工具解决方案。
Comments 30 pages, 1 figure, accepted at the ACM TOSEM journal. arXiv admin note: substantial text overlap with arXiv:2507.06704
通过LLM理解基于规范的代码生成:一项实证研究设计
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文通过实证研究设计,探讨人类干预在基于规范的LLM代码生成过程中对代码质量和动态的影响。
Comments This paper is a Stage 1 Registered Report. The study protocol and analysis plan were peer reviewed and accepted at SANER 2026 with a Continuity Acceptance (CA) score for Stage 2
TTrace: 轻量级的分布式训练错误检查与诊断
机构 * New York University(纽约大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 TTrace通过系统性的差分测试方法,有效检测和定位分布式训练中的无声bug,提升调试效率。
CSF:对比语义特征用于直接多语言手语生成
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 CSF通过九个通用语义槽和综合条件分类法,实现无需英语中介的多语言手语直接生成,提升聋人社区的交流无障碍性。
Comments 9 pages, 8 tables, code available at https://github.com/transybao1393/csf-sign-language
ManiBox: 通过可扩展的模拟数据生成增强具身空间泛化
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Horizon Robotics
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 ManiBox通过可扩展的模拟数据生成提升具身智能体的空间泛化能力,有效减少仿真到现实的差距。
通过检索增强生成和多工具反馈改进LLM辅助的安全代码生成
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 通过检索增强生成和多工具反馈,改进LLM辅助的安全代码生成,显著减少安全漏洞和缺陷率。
GraphLocator: 图引导的因果推理用于问题定位
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 GraphLocator通过因果图发现和动态解构解决软件问题定位中的因果不匹配和一对一不匹配问题,提升定位准确性和下游任务性能。
RLLaVA: 一种面向语言和视觉助手的强化学习中心框架
机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)
专题命中 软件智能体 :agentic(abstract);分类 cs.LG
AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。
Comments The code is available at https://github.com/TinyLoopX/RLLaVA
什么让 GitHub 问题适合 Copilot?
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出32条准则,通过可解释机器学习模型评估GitHub问题质量,提升Copilot合并拉取请求的可能性,模型中位AUC达72%。
在仓库级代码翻译中推进自动化独立验证
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 TRAM通过结合上下文感知的类型解析与基于模拟的独立验证,实现了高质量的编程语言间翻译,尤其在Java到Python的翻译中表现出色。
AutoDFBench 1.0:数字取证工具测试和生成代码评估的基准框架
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 AutoDFBench 1.0 提出了一种统一的自动化基准框架,用于评估数字取证工具、脚本及AI生成代码,通过标准化指标实现工具间的公平比较和可重复验证。
基于学习的探索用于强化学习
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出基于熵的探索方法,通过自适应探索状态空间未探索区域,提升强化学习的效率和学习速度。
Journal ref 2021 21st International Conference on Control, Automation and Systems (ICCAS)
大规模活性粒子系统的有效控制:应用于疏散问题的应用
机构 * AIRI ; Artificial Intelligence Center, Skolkovo Institute of Science and Technology(人工智能中心,斯克洛夫科技研究所) ; Department of Mathematics, University of Leicester(数学系,莱斯特大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出一种结合强化学习与人工力的控制策略,用于机器人救援者高效疏散人群,克服了传统方法的可扩展性和鲁棒性不足问题。
HarnessAgent:利用工具增强的LLM流水线实现自动模糊测试Harness构建的扩展
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 HarnessAgent通过工具增强的LLM流水线实现全自动、可扩展的模糊测试Harness构建,提升生成成功率和代码检索效率。