Bayesian Sequential Verification for Budget-Aware Quantum Program Testing
基于预算的量子程序测试的贝叶斯顺序验证
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出一种基于预算的量子程序测试方法,通过贝叶斯假设检验流程减少测量成本,适用于高成功概率的量子程序。
Comments 7 pages, 1 figure
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于预算的量子程序测试的贝叶斯顺序验证
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出一种基于预算的量子程序测试方法,通过贝叶斯假设检验流程减少测量成本,适用于高成功概率的量子程序。
Comments 7 pages, 1 figure
编码代理是否理解最小特权授权?
机构 * Evolvent AI Research Team(Evolvent AI研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 研究编码代理是否能自主推断最小特权授权边界,提出Sufficiency-Tightness Decomposition方法,提升敏感任务成功率并降低攻击成功率。
CodeDistiller:自动为科学编码代理生成代码库
机构 * University of Arizona(亚利桑那大学) ; Allen Institute for Artificial Intelligence(人工智能研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 CodeDistiller通过自动提炼科学GitHub仓库代码,生成经过验证的领域特定代码库,提升科学发现系统实验的准确性与完整性。
Comments 8 pages, 3 figures, 3 tables. Accepted to ACL 2026 (Demo Track)
BRIDGE: 在领域引导的程序合成中构建表示
机构 * California Institute of Technology(加州理工学院) ; Amazon(亚马逊)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。
Comments 41 pages, 10 figures, 3 tables. Preprint
基于比较的梯度估计的顺序资源交易
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。
从观测中学习POMDP世界模型:利用语言模型先验
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; IRIIS ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; University of Tübingen(图宾根大学) ; University of Oxford(牛津大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。
SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。
PROMETHEUS:整合文本、数据和模型的深度因果研究自动化
机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。
Comments 27 pages
合作者还是助手?AI编码代理如何在拉取请求生命周期中分配工作
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文研究AI编码代理在拉取请求生命周期中如何分配工作,通过分析工具的协作-助手光谱,探讨操作权与合并治理的分离,提出分类学、状态机和可重复实验包。
Comments 10 pages, 8 figures, AIWare 2026 conference
分类器上下文旋转:通过上下文长度监控性能退化
机构 * Anthropic Fellows Program(Anthropic fellows项目)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。
为Julia编程语言设计的极简终端编辑器--MinTEJ:面向科学程序员的友好方法
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出MinTEJ,一种基于终端的Julia编辑器,采用顺序模式交互架构,整合文件管理、代码编辑、执行和调试,降低认知负荷和错误率。
Comments 15 Pages, 42 figures
gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试
机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) ; Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) ; Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。
Comments 26 pages, 4 figures
SkillEvolver: 技能学习作为元技能
机构 * Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 SkillEvolver通过元技能迭代生成、部署和优化领域特定技能,无需重新训练即可直接应用于任何智能体,其学习目标是技能的文本和代码而非模型权重,通过元技能自身作为技能加载,提升技能表现。
教语言模型用代码思考
机构 * Korea University(韩国大学) ; AIGEN Sciences(AIGEN科技)
专题命中 软件智能体 :planning(abstract);分类 cs.CL
AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。
Comments Preprint
EvidenT: 一个证据保留的系统级包修复框架
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文提出EvidenT框架,通过证据管理与工具执行解耦,解决系统级包修复中的依赖和环境配置问题,实验显示其在RISC-V包修复中表现优异,且在不同架构上具有良好的通用性。
干预复杂性作为规范奖励和智能的度量
机构 * School of Computing University of Otago(计算学院奥塔哥大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出干预复杂性作为智能的规范度量,具有环境衍生性、普遍性、最小性、敏感性和成就偏好等性质,通过资源函数定义通用奖励,并探讨智能的双维度表征及计算可性。
Comments 23 pages
SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞
机构 * Stanford University(斯坦福大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。
编码代理不知何时行动
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。
打破、过时或缺失?基于项目级测试演变的基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。
Comments 15 pages, 5 figures
TACT: 通过激活引导缓解编码代理中的过度思考与过度行动
机构 * National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; Meta
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。
Comments Work in progress
比较AI编码代理:一项任务分层的拉取请求接受分析
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文通过分析7156个拉取请求,比较了五个AI编码代理在不同任务类型上的接受率差异,发现文档任务接受率显著高于新功能任务,且OpenAI Codex在多种任务类型中表现优异。
Comments Accepted by MSR'26 Mining Challenge Track
PARNESS:一种用于端到端自动化科学研究的论文工具,支持动态工作流、全文索引和跨运行知识积累
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 PARNESS通过动态工作流、全文索引和跨运行知识积累,解决传统科研系统流程僵化、知识累积不足的问题,实现端到端自动化科研。
Comments 31 pages, 13 figures, includes appendix with a verbatim end-to-end-generated paper produced by the framework. Source: https://github.com/gtrhythm/PARNESS
产品团队中的Vibe编码:重新配置AI辅助的工作流、原型设计与协作
机构 * Netherlands and MIT Media Lab(荷兰和MIT媒体实验室) ; Notion Labs(Notion实验室) ; Collov AI ; Cornell University(康奈尔大学) ; Goizueta Business School, Emory University(埃默里大学戈伊兹埃塔商学院) ; Centrum Wiskunde & Informatica, The Netherlands and Utrecht University, The Netherlands(荷兰代尔夫特理工大学和乌得勒支大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 本文研究Vibe编码如何重塑产品开发流程与协作,揭示其四阶段工作流及带来的效率与创造力提升,同时指出代码不可靠、集成困难等挑战。
CI-Repair-Bench:基于CI工作流的自动化补丁验证仓库意识基准
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 CI-Repair-Bench通过真实GitHub Actions执行构建,提供仓库级程序修复基准,包含567个CI失败实例,细粒度评估12种CI错误类型,揭示自动化修复在局部和工具强制失败上效果最佳,但环境依赖等问题仍具挑战。
野火修复
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究分析了61000余个仓库中的人工和AI代理生成的热修复,发现其具有紧迫性特征,揭示了人类与AI在修复行为上的差异,为实际应用中的热修复协作提供基础。
提示工程报告精简:生命科学领域的快速入门指南
机构 * National Heart & Lung Institute, Faculty of Medicine, Imperial College London(英国伦敦帝国学院医学院国家心脏和肺研究所)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 本文总结了生命科学领域中6种核心提示工程技巧,包括零样本、少样本、思考生成等,旨在提升LLM在文献总结、数据提取等任务中的效率与质量。
MappingEvolve:基于大语言模型的科技映射代码进化
机构 * Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出MappingEvolve框架,利用大语言模型直接进化科技映射代码,通过分层代理架构提升代码优化效果,实验显示在面积减少和延迟平衡方面优于现有方法。
量子电路复杂性与拓扑序的无监督机器学习
机构 * Department of Physics, University of Michigan, Ann Arbor, Michigan 48109-1040, USA(密歇根大学物理系,安娜堡,密歇根州,48109-1040,美国) ; Center for Quantum Computing, RIKEN, Wako-shi, Saitama 351-0198, Japan(日本理化学研究所量子计算中心,武藏野市,埼玉县,351-0198,日本) ; Department of Physics, Zhejiang Sci-Tech University, Hangzhou 310018, China(浙江科技学院物理系,杭州310018,中国)
专题命中 软件智能体 :planning(abstract);分类 cs.LG
AI总结 本文探讨量子电路复杂性作为理解拓扑序无监督机器学习的工具,提出两个定理连接量子路径规划与量子鱼跃复杂度及纠缠生成,展示了基于保真度和纠缠度的相似性度量在量子相变研究中的优越性能。
Comments Updated version; With enriched Supplementary Information; 23 pages; 5 figures. Code is available upon reasonable request, and will be open-sourced along with the publication. Comments are welcome
Journal ref Nature Communications (2026)
多动作纠缠程序图用于具有连续控制的多任务强化学习
机构 * Univ Rennes, INSA Rennes, CNRS, IETR – UMR 6164(里昂大学、里昂国家高等工业学院、国家科学研究中心、IETR – UMR 6164)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出多动作纠缠程序图(MATPG)用于连续多任务强化学习,通过整合MAPLE代理并创建控制流,证明其在多任务场景下的优越性,并展示其可解释性。
Journal ref EuroGP 2026, Apr 2026, Toulouse, France. pp. 259-274
AutoPPA:通过对比代码基于的规则库学习实现自动电路PPA优化
机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所处理器重点实验室,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; University of Science and Technology of China, Hefei, China(中国科学技术大学,合肥,中国) ; Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, China(中国科学院工业人工智能研究所,南京,中国)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 本文提出AutoPPA框架,通过对比生成的代码对自动生成优化规则,提升RTL设计中PPA优化效率,实验表明优于手动优化和现有方法SymRTLO和RTLRewriter。