Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting
停止手把手指导你的编码智能体:设计替代逐步提示的循环机制
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
停止手把手指导你的编码智能体:设计替代逐步提示的循环机制
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。
确保失败安全:一个用于开放网络数据收集的受约束、可验证的智能体框架
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出一个受约束、可验证的智能体框架,通过将LLM输出从自由形式代码转换为类型化JSON收集器配置,结合六类型收集器分类、模板和效用函数约束、静态Airflow DAG执行、基于规则的质量检查和结构化反馈纠正,实现了零执行阶段LLM令牌消耗和最低平均挂钟时间。
Comments 15 pages, 1 figure
AxDafny: Dafny中的智能验证代码生成
机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。
本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; University at Buffalo, SUNY(布法罗大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。
CmdNeedle: 衡量AI智能体命令黑名单的不完备性
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI
AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。
CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统
机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。
Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt
SkillWiki: 一个用于智能体技能的活知识基础设施
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Tencent(腾讯) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL
AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。
AI驱动的软件开发:迈向智能开发过程的务实路径
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 本文提出一个务实框架,指导从辅助性AI使用到可控智能开发过程的过渡,聚焦技术、组织和质量保障机制,并通过中型软件公司案例验证其可行性。
编程语言对你的AI编码队友还重要吗?来自国际象棋引擎的大规模证据
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 通过让前沿AI代理用17种编程语言开发国际象棋引擎,发现AI能生成任何语言的可用系统,但语言选择仍影响性能、成本和功能,主流编译语言才能达到强棋力。
运行时技能审计:针对智能体技能安全的目标运行时探测
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出运行时技能审计(RSA)动态分析方法,通过目标运行时条件探测技能行为,在100个技能上达到90.0%准确率,优于静态基线。
智能体框架的能耗与债务:一项实证研究(注册报告)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。
Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track
TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架
专题命中 软件智能体 :planning(title,abstract);分类 cs.SE
AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。
Comments 11 pages
警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。
Comments Website: https://sites.google.com/view/agentic-botnets/home
KAT-Coder-V2.5技术报告
机构 * KwaiKAT Team(快手KwaiKAT团队)
专题命中 软件智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。
Comments 24 pages, 5 figures
面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复
机构 * School of Software Design and Data Science(软件设计与数据科学学院) ; Seneca Polytechnic(森纳学院) ; Advanced Micro Devices Canada(加拿大先进微器件公司)
专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。
Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication
小科学家:基于大语言模型智能体的科学方法驱动发现
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出The Little Scientist框架,让LLM智能体遵循科学方法迭代探索,在蛋白质适应性预测、DNA基序发现问题上发现了优于现有方案的新算法与集成策略。
Comments Code: https://github.com/travis42/little-scientist-dale and https://github.com/travis42/little-scientist-delta-v (Apache 2.0)
AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈
专题命中 软件智能体 :agentic(title);agent(abstract)
AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。
SynChain:诱导计算机使用智能体系统构建自身攻击链
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。
MetaVideoAgent:面向长视频理解的自动视频智能体进化框架
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; ByteDance(字节跳动)
专题命中 软件智能体 :agent(title,abstract)
AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。
Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 软件智能体 :agent(title,abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。
ORB5X v1.0:一个使用智能AI构建的性能可移植的全局电磁陀螺动力学PIC C++/Kokkos代码
专题命中 软件智能体 :agentic(title);workflow(abstract)
AI总结 本文介绍ORB5X,它是ORB5的C++/Kokkos版本,保留了原Fortran代码的数学模型与算法,通过替换模块和数组提升性能可移植性,经测试与原代码精度相近,且能在多种设备上编译运行。
在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。
Comments 21 pages, including appendix; 2 figures
从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作
专题命中 软件智能体 :agentic(title,abstract)
AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。
Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track
ARTEMIS: 基于智能体引导的可靠性感知时间掩码演化用于不完美监督的视频息肉分割
机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education(东南大学教育部新一代人工智能技术及其跨学科应用重点实验室) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; School of Medicine, Case Western Reserve University(凯斯西储大学医学院)
专题命中 软件智能体 :agent(title,abstract)
AI总结 提出ARTEMIS框架,利用视觉语言智能体选择可靠时间锚点,结合SAM2传播和可靠性感知鲁棒学习,从不完美监督(点、涂鸦、少量密集标签)中学习高质量视频息肉分割掩码,在多个基准上达到最优性能。
PhantomSkill: 代理技能生态系统中的恶意代码注入
专题命中 软件智能体 :agent(title,abstract)
AI总结 提出PhantomSkill攻击框架,通过VulMask技术将恶意行为隐藏在技能的辅助资源中,利用漏洞形状的实现绕过检测,在保持良性功能的同时降低警告和恶意软件检测率。
并非所有技能都有用:测量与修复智能体知识
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Purdue(普渡大学) ; NVIDIA(英伟达)
专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。
Comments 18 pages, 5 figures
HDRAgent: 一种用于多曝光HDR成像的智能体框架
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) ; Zhejiang University(浙江大学) ; Camera Group, DJI(大疆相机部门)
专题命中 软件智能体 :agentic(title);agent(abstract)
AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。
什么因素导致软件问题解决任务对智能体而言难度较高?
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究提出测量框架,基于CoderForge-Preview数据集的实证分析,发现软件问题解决任务难度可通过静态特征预测,核心驱动因素为补丁碎片化与代码库规模,为构建难度可控的智能体评估基准奠定基础。
Comments To appear in ESEM 2026
StagedWorkspace:面向知识工作智能体的版本化工作空间
机构 * Harvard University(哈佛大学) ; Raycaster AI(雷caster人工智能公司) ; University of Technology Sydney(悉尼科技大学) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agent(abstract,abstract_cn);AI agent(abstract);分类 cs.AI
AI总结 该研究针对知识工作智能体的版本化工作空间问题,提出StagedWorkspace方案,通过绑定解析记录与原生文件内容哈希提升性能,在OfficeQA Pro等数据集上取得显著优于基准的效果,为相关基准构建提供了新方向。
Comments Under Review
代码作为表示:学术文档的可编译解析范式
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL
AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。
Comments Accepted by ACM MM 2026