AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents
AgentWard: 为自主AI代理设计的生命周期安全架构
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI
AI总结 本文提出AgentWard架构,通过跨层协调实现对自主AI代理五个阶段的安全防护,展示了一个原型实现,为运行时安全控制提供了具体蓝图。
Comments 7 pages, 1 figure;
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AgentWard: 为自主AI代理设计的生命周期安全架构
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI
AI总结 本文提出AgentWard架构,通过跨层协调实现对自主AI代理五个阶段的安全防护,展示了一个原型实现,为运行时安全控制提供了具体蓝图。
Comments 7 pages, 1 figure;
SWE-QA: 语言模型能否回答仓库级代码问题?
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL、cs.SE
AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。
Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench
GCP: 带空间-时间感知恶意代理检测的防护协作感知
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Department of Robotics, University of Michigan(密歇根大学机器人系)
专题命中 软件智能体 :agent(title,abstract)
AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。
Comments Accepted by IEEE TDSC
Vibe Medicine:通过人机协作重新定义生物医学研究
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系)
专题命中 软件智能体 :agent(abstract,abstract_cn);AI agent(abstract);分类 cs.AI
AI总结 本文提出Vibe Medicine,通过自然语言指导AI代理执行复杂生物医学流程,解决多领域数据整合与分析难题,提升研究效率与公平性。
AI代码库成熟度模型:从辅助编码到完全自主系统
机构 * IBM Research — Hybrid Cloud and AI Platform(IBM混合云和人工智能平台研究院)
专题命中 软件智能体 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出AI代码库成熟度模型(ACMM),通过100天经验报告和Hive系统验证,展示代码库从基础AI辅助到完全自主的六级进化框架,强调测试覆盖率和反馈机制是关键因素。
Comments 30 pages, 7 tables. v2: Extended to 6 levels. Added Level 6 (Fully Autonomous), Hive reference implementation, Beads for agent memory continuity, throughput acceleration data. Metrics updated to 100 days. Source: https://github.com/kubestellar/console and https://github.com/kubestellar/hive
无测试用例,无问题:基于知识蒸馏的科学工作流代码生成
机构 * Purdue University(普渡大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出MOSAIC框架,通过知识蒸馏和结构化问题分解实现无测试用例的科学代码生成,提升准确性和执行精度。
KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; School of Computer Science, Wuhan University(武汉大学计算机科学系)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。
Comments Accepted by ACL 2026
AI辅助代码审查作为代码质量和自主学习的支架:经验报告
机构 * The University of Melbourne(墨尔本大学) ; University of Eastern Finland(东芬兰大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了AI辅助代码审查在软件工程教育中的应用,通过混合方法设计分析了学生自主学习过程,发现工具优化后技术问题显著减少,且AI审查的响应率稳定,提出了AI审查在教育中的设计和教学建议。
Comments 11 pages, 3 figures, 3 tables
大语言模型调试的系统方法
机构 * IBM Research(IBM研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。
新的凸编程技术用于纳什社会福利与调度问题
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出了一种新的凸编程方法,用于解决加权纳什社会福利问题,通过Feng和Li的舍入算法达到(e^{1/e})近似比。该方法将指数规模的配置线性规划转换为多项式规模的紧凑线性规划,解决了标准线性规划求解问题。
Comments Accepted in ICALP 2026
密码学中混合策略的Stackelberg模型
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出基于Stackelberg博弈的密码学混合策略模型,分析防御方在资源约束下选择加密算法与攻击方选择密码分析方法的互动,通过动态规划和线性规划解决安全与成本平衡问题。
Comments 27 pages, 2 figures
基于大语言模型的代理楼层计划解析用于视障和低视力人士的无障碍室内导航
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文提出一种基于代理的框架,将单张楼层平面图转换为结构化的知识库,生成安全的无障碍导航指令。系统通过多代理模块生成空间知识图谱,并通过路径规划器生成导航指令,实验结果显示在真实场景和基准数据集上均优于单次调用基线。
Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力
机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。
Comments 19 pages, 15 figures
AutoGUI-v2:一个全面的多模态GUI功能理解基准
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; New Laboratory of Pattern Recognition(模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation(香港科学创新研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);autonomous agent(abstract)
AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。
Comments Technical Report
InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助
机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI
AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。
Comments 15 pages, 10 figures
Proteus:通过多级智能适应实现移动端的桌面可视化变形
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 Proteus通过多级智能适应技术,自动将桌面可视化转换为移动端可读的可视化,解决移动端屏幕尺寸和交互方式差异导致的显示问题。
Comments accepted by ACM Designing Interactive Systems Conference
增强隐私保护的移动GUI代理:可用但不可见
机构 * Tsinghua University(清华大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。
Comments 15 pages, 4 figures
GoClick:轻量级元素接地模型用于自主GUI交互
机构 * 1 University of Chinese Academy of Sciences, Beijing, China. 2 New Laboratory of Pattern Recognition, State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China. 3 Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences, Hong Kong, China. Zhaoxiang Zhang
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文提出GoClick,一种轻量级GUI元素接地模型,通过改进架构和数据精炼流程,在保持高精度的同时降低参数规模,适用于资源受限设备的低延迟GUI交互任务。
Comments Technical Report
通过方向感知的凸自由区域生成实现未知和杂乱环境中的安全导航
机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出一种结合候选运动方向与机器人几何的凸自由区域生成框架,通过连续安全轨迹生成实现持续无碰撞运动,实验表明该方法在杂乱2D导航场景中生成更符合后续导航的自由区域,并在3D和真实世界中验证了其扩展性和实用性。
无线移动充电用于紧急电动汽车路线规划:一种混合整数和元启发式框架用于行驶中的能量传输
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出无线移动充电电动汽车路线规划问题,通过感应耦合实现移动充电卡车对行驶中的电动汽车无线充电,结合混合整数规划和元启发式算法优化异构车队的路线与动态能量传输。
Comments 8 pages, 5 figures
从无状态查询到自主行动:面向代理AI系统的分层安全框架
机构 * School of Computing, University of Connecticut(康涅狄格大学计算机学院)
专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 本文提出分层攻击面模型,分析代理AI系统安全威胁的分层结构与时间维度,揭示高层攻击与慢烧时间的交集区域,提出跨层防御体系,强调将代理安全视为嵌入对抗生态的分布式系统问题。
Comments 23 pages, 3 figures, 10 tables
代理辅助的动态CAD模型设计
机构 * Independent Researcher(独立研究者) ; MIT(麻省理工学院)
专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出AADvark代理系统,能生成具有运动部件的复杂3D装配体,通过整合外部约束求解器和视觉反馈机制解决空间推理问题。
Comments 5 pages, 3 figures, published in CAIS'26
Poster: ClawdGo: 内生安全意识训练用于自主AI代理
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Network Management Center, China Mobile Group Liaoning Company Limited(中国移动集团辽宁公司网络管理中心) ; Tencent Security Xuanwu Lab(腾讯安全宣武实验室) ; China Unicom Online Information Technology Co., Ltd.(中国联通在线信息技术有限公司)
专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出ClawdGo框架,通过内生训练提升自主AI代理的安全意识,引入TLDT、ASAT、CSMA和SACP四种贡献,实验显示ASAT在16次会话中提升TLDT得分,CSMA保持完整收益,SACP在高训练代理中观察到精度-召回权衡。
Comments 4 pages, including 1 poster page. Poster abstract and poster version
ContextWeaver:面向LLM代理的选型与依赖结构化记忆构建
机构 * UT Austin(得克萨斯大学奥斯汀分校) ; AWS AI Labs(AWS人工智能实验室)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL
AI总结 本文提出ContextWeaver,通过构建推理步骤图谱,实现LLM代理的记忆选择与依赖结构化,提升长上下文交互性能,减少推理步骤与token消耗。
RouteGuard: LLM代理中技能中毒的内部信号检测
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本文提出RouteGuard,通过响应条件注意力和隐藏状态对齐检测LLM代理中的技能中毒,实验证明其在真实和合成数据上表现优异,有效恢复被词法筛选遗漏的攻击。
Spore:通过推理时间混合探测实现高效的隐私提取攻击
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出Spore攻击,通过推理时间混合探测实现对LLM内存的隐私提取,无需训练,适用于黑盒和灰盒环境,具有高效查询和高信息泄露率。
信息记忆塑造智能群体的集体行为
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究通过实验和理论分析,探讨信息记忆如何影响智能群体的集体行为,揭示信息处理与物理交互的协同作用。
Journal ref Physical Review Letters, 136, 138302, 2026
Dr. RTL:通过工具引导的自我改进实现自主代理RTL优化
机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学)
专题命中 Agent评测 :agentic(title,abstract);autonomous agent(title);agent(abstract);workflow(abstract)
AI总结 Dr. RTL通过真实环境下的闭环优化和群体相对技能学习,提升RTL时序优化的性能、功耗和面积指标,实现更高效的自改进优化方法。
治理你无法观察的事物:面向自主AI代理的自适应运行时治理
机构 * Department of Computing, University of Turku(图尔库大学计算机系)
专题命中 Agent评测 :agent(summary_cn,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。
AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL、cs.SE
AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。
Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables