On the $k$ Nearest-Neighbor Path Distance from the Typical Intersection in the Manhattan Poisson Line Cox Process
专题命中 工作流自动化 :planning(abstract)
Journal ref IEEE Trans. Mobile Computing 22 1659-1671 (2021)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工作流自动化 :planning(abstract)
Journal ref IEEE Trans. Mobile Computing 22 1659-1671 (2021)
专业软件开发者不随性,他们掌控:2025年AI代理在编程中的使用
机构 * Cornell University(康奈尔大学)
专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了2025年经验丰富的软件开发人员如何利用AI代理进行编程,发现开发人员通过保持自主权和专业知识来控制代理行为,以确保软件质量。
对抗评审:基于结构化分歧的 grounded 智能体代码评审
机构 * Cornell University(康奈尔大学) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出对抗评审(AR)协议,仅用3个智能体实现结构化分歧的协作代码评审,在LiveCodeBench、SWE-PRBench等基准上优于多智能体基线,证明无需大量智能体即可完成高效代码评审。
Comments Accepted to ICML 2026 Workshop on DL4C
锯齿状前沿:评估代码智能体对语义保留转换的鲁棒性
专题命中 软件智能体 :agent(summary_cn,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 该研究评估AI代码智能体对语义保留代码转换的鲁棒性,发现其存在锯齿状鲁棒性前沿,mini-SWE agent更鲁棒,顶级模型仍易受此类扰动影响,引发部署可靠性担忧。
Comments 18 pages, 6 figures
用智能体机器人技术重新审视“Push-T”机器人操作任务
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。
机构 * University of California, San Diego, USA(加州大学圣迭戈分校) ; Intel Corporation(英特尔公司)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。
SeqFeed:通过顺序行为反馈改进智能体RTL代码生成
专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL
AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。
什么因素导致软件问题解决任务对智能体而言难度较高?
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究提出测量框架,基于CoderForge-Preview数据集的实证分析,发现软件问题解决任务难度可通过静态特征预测,核心驱动因素为补丁碎片化与代码库规模,为构建难度可控的智能体评估基准奠定基础。
Comments To appear in ESEM 2026
超越布局与关节运动:面向具身交互的使用驱动型代码场景
机构 * Meituan(美团)
专题命中 软件智能体 :agent(abstract);agentic(abstract)
AI总结 针对现有代码场景生成方法未建模场景功能使用的问题,提出RoomWright框架,通过使用驱动型物体推理与代码智能体实现可执行、可编辑的仿真就绪3D场景,为具身AI与策略学习提供交互式环境。
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层
专题命中 软件智能体 :agent(abstract);workflow(abstract)
AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。
一种面向可重复、低代码定位的配置优先框架
机构 * Jožef Stefan Institute(乔塞夫·斯蒂芬研究所)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE
AI总结 本文提出了一种低代码、配置优先的框架,通过版本化配置和自动化流程提升定位任务的可重复性和效率。
Comments 16 pages, 8 figures
ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复
机构 * Huawei(华为) ; HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。
当代理失效:对LLM代理中bug的全面研究与自动化标记
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。
Comments Accepted at ISSRE 2026
优化器系统的模拟优化:利用内部优化的几何结构
专题命中 软件智能体 :agent(abstract)
AI总结 该研究针对优化器系统(SOSO)的模拟优化,提出利用内部优化几何结构的 PRIME 求解器,在多类测试平台上实现了优异性能,大幅降低了方差,为模拟优化提供了新方向。
r2py:用于AI辅助将R统计包转换为Python的框架
专题命中 软件智能体 :agentic(abstract)
AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。
Comments v2: substantially extended. Adds a second case study (rpart) reached through R's .Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened
用于血管内导航多任务世界模型控制的渐进式经验融合
机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) ; Surgical & Interventional Engineering(外科与介入工程)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。
测量悬赏清单中的证明负担:RentAHuman案例研究
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract)
AI总结 本研究以RentAHuman平台为案例,通过审核981个悬赏清单,测量证明负担,发现56.2%的清单证明负担评分达4或5分,且智能体/机器人标记的清单更常要求现实世界行动等证明。
Comments Accepted at ACM HCOMP 2026 (2026 ACM Conference on Human-AI Complementarity and Alignment), September 27-30, 2026, Alexandria, VA, USA. 10 pages, 4 figures, 3 tables. Camera-ready version; published version DOI: 10.1145/3834580.3838744
ComponentBench:诊断计算机使用智能体的组件级故障
机构 * Duke University(杜克大学) ; Amazon AGI SF Lab(亚马逊AGI旧金山实验室)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出ComponentBench基准及诊断流水线,评估7种计算机使用智能体在4种观测动作空间下的表现,发现观测动作空间会显著影响性能,且空间操作仍是智能体的挑战。
Comments Accepted at COLM 2026. 30 pages (10 pages main text), 10 figures, 15 tables. Website: https://componentbench.com Code: https://github.com/TianchenGuan/ComponentBench Data: https://huggingface.co/datasets/TianchenGuan/ComponentBench
智能体AI的涌现:关于演进、背景、工作原理、应用、采用因素及未来研究方向的综述
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本系统综述梳理智能体AI的演进、原理、应用等,构建利益相关者采用框架,为相关人员提供该领域现状、缺口及未来方向的全面见解。
Comments Accepted Version, 54 Pages, 13 tables, 7 images
Journal ref Emergence of Agentic AI: A Review on Evolution, Background, Working Principles, Applications, Adoption Factors, and Future Research Directions. Computers, Materials & Continua, 88(2), 9
迈向可逆遗忘:在持续式企业智能体中管理过时知识
专题命中 记忆与上下文管理 :AI agent(title,abstract);分类 cs.LG
AI总结 针对企业AI智能体在非平稳环境中面临的过时知识问题,提出含三种记忆状态的可逆遗忘框架,实例化为滞后可逆记忆控制器,可减少过时信息影响且不混淆临时抑制与永久擦除,金融场景可验证其思路。
FactorMiner: 一种具备技能与经验记忆的自演化代理,用于金融alpha发现
专题命中 记忆与上下文管理 :agent(title,abstract)
AI总结 FactorMiner通过模块化技能架构和经验记忆实现自演化,有效挖掘高可解释性的金融alpha因子,降低冗余并提升性能。
FACET:在终端任务合成中保留源意图与可执行状态
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI
AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。
面向大语言模型的无训练推理时自我反思与成本受限早停机制
机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) ; School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)
专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。
利用工具链持续学习:超越模型参数的持续适应
机构 * University of Wollongong(卧龙岗大学) ; Nanjing University(南京大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。
用深度置信网络和双向门控循环单元对三态多数投票模型临界态附近的定向轨迹进行分类
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本研究用DBN与Bi-GRU处理MV3轨迹分类问题,DBN编码静态快照,Bi-GRU实现四类轨迹近乎完美分离,可实时感知MV3动态 regime,为意见动力学模型临界转变检测提供分层架构。
Comments 8 pages, 6 figures, to be published in AIxSET 2026
CHIIR 2026 第一届面向交互式信息获取的以人为中心的主动式与个性化智能体研讨会报告
专题命中 记忆与上下文管理 :agentic(abstract)
AI总结 该报告总结了CHIIR 2026第一届相关研讨会,探讨交互式信息获取向主动个性化智能体转变的机遇与问题,明确主动的核心内涵并梳理出相关设计挑战。
FinSkillBench:评估用于投资管理的智能体AI与领域技能
机构 * Deep Insight Labs(深洞察实验室) ; University of Kent(肯特大学) ; University of Cambridge(剑桥大学)
专题命中 Agent评测 :AI agent(title);agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI
AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。
工具到实体的阈值:共享社交空间中个性化AI智能体的准社会动态
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 该研究提出身份标记框架,结合自传式民族志方法,揭示共享社交空间中个性化AI智能体从工具转变为社会实体的四种新动态,指出现有同意框架混淆了智能体存在与消息处理的同意。
Comments 24 pages, 3 figures, 2 tables; corpus message count corrected to ~16,000; scope and consent basis unchanged. Threshold claim reframed as categorical rather than discrete; adds §5.4 and H4