Evolving Ensemble of Agents
进化代理群体
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
进化代理群体
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。
JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。
可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。
Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026
OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。
AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。
Comments Accepted to ASE '26
对软件工程任务中投机解码的实证研究
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
用于模拟真实城市几何中住宅入室盗窃的有限元框架
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种有限元框架,将基于智能体的概率入室盗窃模型转化为PDE模型,采用解耦方案求解,经芝加哥市真实几何测试,鲁棒高效且开源,为多尺度多物理场模型研究奠基。
导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配
专题命中 GUI与网页智能体 :agent(title);workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。
面向质量多样性的Web智能体模仿的推测性回滚修正
机构 * Beihang University(北京航空航天大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。
基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算
机构 * Nanyang Technological University(南洋理工大学) ; Singapore Institute of Technology(新加坡理工学院) ; Seatrium New Energy Laboratory(Seatrium 新能源实验室) ; Ministry of Education (MOE) Tier 1(教育部 Tier 1) ; Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。
Comments 37 pages
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: http://mobilemem.openkg.cn/
VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示
机构 * Peking University(北京大学) ; PrimeBot
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。
Comments accepted by ACM MM 2026
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE
AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。
Comments 6 pages. Accepted to the ISSTA 2026 Tool Demonstrations Track; published in the Companion Proceedings of SPLASH Companion '26
屏幕之外的评估:与资源受限创业者共同评估AI生成的商业计划书
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 该研究针对资源受限创业者,将BizChat工具扩展出评估模块,通过小组讨论让14名参与者集体评估AI生成的商业计划,发现该方式能提升评估效果。
通过从野外视频进行可扩展学习揭示具身城市导航中的长尾分布
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 该研究提出可扩展框架,从网络规模野外 egocentric 视频学习点目标城市导航策略,自动注释视频并训练视觉-语言-动作策略,表征并诊断导航长尾分布与失败模式,验证了知识迁移效果并揭示长尾结构。
机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)
专题命中 GUI与网页智能体 :planning(abstract)
Comments accepted by IROS 2025
MELD:一种用于合并分布式智能体记忆中知识的协议
专题命中 记忆与上下文管理 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本文提出MELD协议,实现分布式智能体记忆的知识合并,经实验验证其在存储、召回率、一致性及消息量上均优于基线,可支撑自治智能体联邦的知识协同。
Comments 30 pages, 3 figures, 1 table, plus an 11-page appendix (A-N). Code and experiment data: https://doi.org/10.5281/zenodo.21878274
智能体原生遥测:面向自主操作的可验证状态增量证据
专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。
Comments 13 pages, 3 figures, 6 tables
基于基元语言的智能体AI晶体结构设计
专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 该研究提出智能体AI框架MatEvolve,以基元语言设计晶体,在贫稀土永磁体设计中发现新结构原型的频率是生成模型的三倍以上,可揭示结构-性能关系。
从大语言模型(LLM)推理到智能体工作负载:特征分析与服务系统启示
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出AgentSysBench基准套件,分析智能体工作负载与传统LLM服务的6项差异,据此开展的4项设计探索可实现延迟降低、效率提升、内存减少及冗余调用节省等效果。
拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用
专题命中 记忆与上下文管理 :autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。
用强化学习替代天气和气候模型中的可调参数以状态依赖函数
机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) ; School of Mathematical Sciences, Lancaster University(兰卡斯特大学数学科学学院) ; Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) ; Met Office Hadley Centre(英国气象局哈德利中心)
专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 本文通过强化学习在线学习天气和气候模型中的参数方案,展示了在简化测试环境中,强化学习在气候偏差校正、辐射-对流平衡和纬向平均能量平衡模型中的应用,证明了强化学习在改进模型性能方面的有效性。
Comments 79 pages, 24 figures
Journal ref Journal of Advances in Modeling Earth Systems (JAMES) 18 (8), e2026MS005745
Zetta ζ:用于自进化物理智能的高效闭环具身框架
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Z-Trans AI
专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)
AI总结 Zetta ζ是一种闭环具身框架,通过时间尺度分离的循环进化评判器与恢复技能,结合Z-Infra在LIBERO-Pro、RoboCasa上实现90.8%、93.6%的成功率,为物理智能扩展提供路径。
FreeToken:面向边缘原生MoE服务的带宽自适应高效执行方案
专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)
AI总结 FreeToken是边缘原生MoE服务系统,通过协同设计服务栈实现带宽自适应执行,将个人计算机转化为弹性推理平台,可在边缘硬件上部署大参数MoE模型,拓展了本地AI服务能力。
Evo-Harness:面向自进化智能体的上下文到 harness 的技能编译
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对现有自进化 LLM 智能体方法的不足,提出 Evo-Harness 框架,通过上下文到 harness 的技能编译提炼单次执行的噪声上下文,在五个现实基准上验证了其有效性,为 LLM 智能体即时学习提供了原则性理解。
AWED-FiNER: 基于代理、网络应用和专家检测器的细粒度命名实体识别工具,支持36种语言,覆盖66亿使用者
机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈蒂分校)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 AWED-FiNER提供支持36种语言的细粒度命名实体识别解决方案,包含代理工具、网络应用及53种先进专家模型,适用于多语言和低资源场景。
Comments Paper title updated
Valhalla:面向长期科学知识工作的分层知识状态与服务治理框架
专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI
AI总结 Valhalla是面向长期科学知识工作的分层框架,采用FREG模型与服务治理架构,经抗体设计任务验证,可将个性化知识结构转化为可共享重组的协作知识状态。
HyperSkill:基于超图结构技能记忆的自进化大语言模型智能体
机构 * University of Southern California(南加州大学) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; Northwestern University(西北大学)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL
AI总结 本文提出HyperSkill超图记忆框架,解决LLM智能体记忆设计的存储、检索与进化问题,在多数据集上较10种基线取得显著性能提升。
Comments 25 pages
面向人体状态转换的生理世界模型
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI
AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。