Spec Kit Agents: Context-Grounded Agentic Workflows
Spec Kit Agents:基于上下文的代理工作流
专题命中 工作流自动化 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Spec Kit Agents:基于上下文的代理工作流
专题命中 工作流自动化 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。
Flowr -- 通过大规模超市连锁中的代理AI实现零售供应链运营的扩展
机构 * Old Dominion University(老道明大学) ; Florida International University(佛罗里达国际大学) ; Nanyang Technological University(南洋理工大学) ; University of Colombo(科伦坡大学) ; Center for Wireless Communications, University of Oulu(奥卢大学无线通信中心) ; University of Sri Jayewardenepura(斯里贾亚瓦德纳普拉大学) ; Accenture Technology Labs(埃森哲技术实验室)
专题命中 工作流自动化 :agentic(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本文提出Flowr框架,通过代理AI自动化大规模超市连锁的端到端供应链流程,减少人工协调负担,提升供需匹配度和异常处理能力。
迈向可信报告生成:一种带有逐步置信度估计和校准的深度研究代理
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Southeast University(东南大学)
专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出一种深度研究代理,通过逐步置信度估计和校准提升报告生成的可信度,增强透明度和用户信任。
Comments 20 pages, 3 tables, 2 figures
COSMO-Agent:增强工具的代理用于闭环优化、仿真和建模协调
机构 * Northwestern Polytechnical University(西北工业大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI
AI总结 本文提出COSMO-Agent框架,通过强化学习使LLM完成闭环CAD-CAE流程,解决CAD-CAE语义鸿沟问题,提升设计效率和稳定性。
Comments 10 pages, 3 figures, preprint paper
一种用于儿童病理科报告的半自动化标注工作流程使用小型语言模型
机构 * Imperial College London(帝国理工学院) ; NHS England(英国国家医疗服务体系) ; Great Ormond Street Hospital(大奥蒙德街儿童医院) ; University College London(伦敦大学学院)
专题命中 工作流自动化 :workflow(title,abstract);分类 cs.CL
AI总结 本文提出一种基于小型语言模型的半自动化标注流程,用于从非结构化电子病历数据中提取结构化信息,尤其针对儿童病理科报告,通过临床监督和少量示例提升提取准确性。
Comments 36 pages, includes supplementary information
HTC-Claw:通过高通量计算活动实现发现自动化
专题命中 工作流自动化 :agent(abstract);workflow(abstract)
AI总结 本文提出HTC-Claw平台,通过智能分解研究目标、闭环执行引擎和自适应决策机制,提升材料发现的自动化水平。
通过受限数据合成和渐进奖励训练LLM进行多步骤工具协调
机构 * Amazon Services Inc.(亚马逊服务公司) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) ; School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院)
专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG
AI总结 本文提出强化学习框架解决LLM多步骤工具协调难题,通过构建确定性环境和渐进奖励机制提升执行准确率,并在不同API生态中实现技能迁移。
Comments Under Review
从Cool演示到生产级FMware:核心挑战和技术路线图
机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) ; Queen's University(女王大学)
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了从演示级到生产级FMware的过渡挑战,分析了FMware选型、数据对齐、提示工程等关键问题,并提出技术路线图以指导其规模化应用。
GLUE:协调预训练生成模型进行系统级设计
机构 * Department of Engineering, University of [REDACTED]([已编辑]大学工程系) ; Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系)
专题命中 工作流自动化 :workflow(abstract);分类 cs.LG
AI总结 本文提出GLUE方法,通过协调预训练生成模型生成可行、多样且高性能的系统设计,对比了数据驱动和无数据方法的性能与效率。
Comments 12 pages, 10 figures, Preprint
迈向工业级产品配置
专题命中 工作流自动化 :workflow(abstract);分类 cs.SE
AI总结 本文提出基于COOM语言的产品配置解决方案,通过三个递增复杂度的基准模型和自行车示例,提供可扩展的工业级产品配置框架。
Comments Under consideration in Theory and Practice of Logic Programming (TPLP)
在Minecraft游戏中多模态大语言模型代理的经验迁移
专题命中 工作流自动化 :agent(abstract);分类 cs.AI
AI总结 本文提出Echo框架,通过分解经验为五维,使代理能从历史交互中提取可操作知识,提升复杂环境下的任务解决效率。
不要盲目行动:通过动作-效果验证和自我修正实现鲁棒的GUI自动化
机构 * Beijing University of Technology(北京工业大学) ; Baidu Inc.(百度公司)
专题命中 工作流自动化 :agent(abstract);分类 cs.CL
AI总结 本文提出VeriGUI框架,通过动作-效果验证和自我修正机制,解决GUI自动化中环境噪声导致的失败问题,提升恢复性能。
Comments ACL 2026 Main Conference
BOS-Lig数据集:通过共识方法准确确定66,810种实验合成配体的电荷
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文通过共识方法构建了BOS-Lig数据集,准确确定了66,810种配体的电荷,为计算筛选和数据驱动的配体设计提供了实验基础。
带有标识符的Petri网的正确性概念
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出适用于描述信息系统的Petri网扩展形式,探讨了资源和对象感知信息系统的正确性标准,并讨论了其在特定系统类中的可判定性。
Journal ref Fundamenta Informaticae, Volume 190, issues 2-4: Petri Nets 2022 (February 12, 2024) fi:10489
机器人辅助乳腺X光检查中的危险管理
机构 * York and Scarborough Teaching Hospitals NHS Foundations Trust(约克和斯卡伯勒教学医院NHS基金会信托)
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种针对MammoBot辅助机器人系统的危险管理方法,结合专家引导的过程建模与SHARD和STPA分析,识别人类-机器人交互中的安全隐患,通过制定安全需求减少对人类操作的依赖。
Gym-Anything: 将任意软件转化为智能体环境
机构 * CMU(卡内基梅隆大学)
专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。
从OpenClaw的取证分析为基础的代理AI研究基础
机构 * KASTEL Security Research Labs, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院 KASTEL 安全研究实验室) ; Fraunhofer Institute for Communication, Information Processing and Ergonomics FKIE(弗劳恩霍夫通信、信息处理与人体工程学研究所 FKIE)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文通过分析OpenClaw的技术设计,提出了一种系统化的代理AI取证方法,揭示了代理执行带来的抽象层和非确定性挑战,为代理AI的系统研究提供了基础。
Comments Preprint. Code and experimental data available at: https://github.com/jgru/forensic-analysis-of-openclaw
知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。
Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures
TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。
Comments Accepted by FSE'26
面向决策的编程:Aporia
专题命中 软件智能体 :agent(abstract);AI agent(abstract)
AI总结 本文提出面向决策的编程范式,通过Aporia工具增强设计过程的参与度,提升代码实现的准确性。
Comments 11 pages, 7 figures
通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。
Squeez:面向编码代理的任务条件工具输出剪枝
机构 * KR Labs(KR实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文研究了编码代理的任务条件工具输出剪枝,通过构建11477个示例的基准测试集,利用Qwen 3.5 2B模型实现92%的输入token剪枝,达到0.86召回率和0.80 F1分数,优于零样本模型和启发式基线。
Comments 7 pages
gyaradax:局部回旋动力学JAX代码
专题命中 软件智能体 :agentic(abstract)
AI总结 gyaradax是用于局部回旋动力学的JAX/CUDA求解器,结合GPU加速和自动微分,验证了与GKW的正式一致性和统计一致性,同时实现了显著加速,展示了编码代理在复杂Fortran代码转换中的高效性。
Comments Code: https://github.com/gerkone/gyaradax
PII Shield:一种浏览器层面的叠加层,用于在AI交互中实现用户控制的个人可识别信息(PII)管理
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)
AI总结 本文提出PII Shield,通过企业级红actions管道,为用户提供直观的免费AI交互隐私保护体验,引入本地实体匿名化和干扰第三方分析的'烟雾'机制,以平衡用户数据使用与隐私保护。
Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End
空间时间连续学习用于移动边缘UAV网络:缓解灾难性遗忘
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文提出STCL框架,通过G-MAPPO算法结合GDPO机制和梯度正交化层,平衡异质目标,提升UAV网络在动态环境中的服务可靠性与性能。
Comments 13 pages, 4 figures, 2 tables, manuscript submitted to IEEE journal for possible publication
一次投毒,永久利用:针对网络代理的环境注入内存投毒攻击
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Amazon Web Services(亚马逊云服务)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究提出eTAMP攻击,通过环境观察污染代理内存,实现跨会话和跨网站的持久化攻击,实验显示攻击成功率高达32.5%,且环境压力下代理易受攻击,高能力模型同样存在漏洞。
平方根时间原子重构计划用于晶格形移动镊子
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出一种可扩展算法,通过并行化原子运输生成二维晶格图案,将运输时间降至O(√N),并利用分治策略和peephole优化技术,实现总运输成本降低至现有算法的1/7,同时提升原子捕获率。
Comments 30 pages, 12 figures
面向自动漏洞生成的多智能体框架:基于约束引导的推理与反思
专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title,abstract);分类 cs.SE
AI总结 本文提出Vulnsage多智能体框架,通过分解复杂漏洞生成过程为多个专业化子智能体,结合LLM生成候选漏洞利用代码,并通过反馈驱动的自完善循环提升漏洞生成效率与准确性,实验证明其在生成漏洞利用代码和发现零日漏洞方面优于现有工具。
Journal ref 34th IEEE/ACM International Conference on Program Comprehension (ICPC '26), April 12--13, 2026, Rio de Janeiro, Brazil
MemFactory: 用于智能体记忆的统一推理与训练框架
专题命中 记忆与上下文管理 :agent(title);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 MemFactory 提供统一的训练和推理框架,通过模块化设计和 GRPO 算法提升记忆增强智能体的性能,实验显示其在多个任务中表现优于基线模型。
Comments fixed Figure 1 typos, clarified ambiguous wording in the abstract, added 1 missing citation, Code: https://github.com/MemTensor/MemFactory
UserCentrix: 一种面向智能空间的代理增强型AI框架
机构 * RISE Research Institutes of Sweden(瑞典RISE研究所) ; ICREA Barcelona(巴塞罗那ICREA)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出UserCentrix框架,通过紧急意识和意图驱动决策机制优化资源管理,提升用户体验,在边缘计算条件下实现高效意图处理与实时监控。