arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-21 至 2026-08-21 共收录 169 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 21 篇

2608.19836 2026-08-21 cs.LG cs.AI cs.LO 新提交 62%

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

通过学习马尔可夫决策过程(MDP)实现自适应概率屏蔽用于安全强化学习

Astrid Horn Brorholt, Maris F. L. Galesloot, Nils Jansen, Kim Guldstrand Larsen, Christian Schilling

机构 * Aalborg University(奥尔堡大学) Radboud University(拉德堡德大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对已知MDP转移图但转移概率未知的场景,提出将概率屏蔽与在线模型学习结合的自适应方法,通过实验验证其在安全强化学习中的有效性。

Comments 19 pages, 3 figures, 3 tables. To be published in the proceedings of RV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19282 2026-08-21 stat.ME cs.LG 新提交 57%

Recovering Nonlinear Functions of Latent Variables: A Plausible-Value Neural Network Framework

恢复潜变量的非线性函数:合理值神经网络框架

Eunjeong Song, Sehee Hong

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 该研究提出PV-ANN框架,通过埃尔米特多项式展开推导边界,在非线性低信度条件下可大幅缩小潜变量非线性函数的恢复差距,且预测准确率未提升,符合理论预期。

Comments 51 pages, 4 figures, 24 tables. Data, materials, and code: https://doi.org/10.7910/DVN/KD61HA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19838 2026-08-21 cs.AI cs.PL 新提交 57%

Specification-delta-driven data governance: an empirical study of the «spec-delta» as the unit of change in lakehouse data platforms

规范增量驱动的数据治理:以“规范增量(spec-delta)”作为湖仓数据平台变更单元的实证研究

Pablo Ramirez Amador

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本研究通过对照实验,验证以spec-delta为变更单元的数据治理工作流,可减少缺陷、降低评审认知负荷,提供避免过度规范的指南,而非开发工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19472 2026-08-21 cs.CL 新提交 57%

SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit

SynFlow:一个多维历时语义分析工具包

Bach Phan-Tat, Kris Heylen, Dirk Geeraerts, Stefano De Pascale, Dirk Speelman

机构 * KU Leuven(鲁汶大学) Instituut voor de Nederlandse Taal(荷兰语言研究所) Vrije Universiteit Brussel(布鲁塞尔自由大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 SynFlow是用于语言使用多维历时分析的开源工具包,支持多维度分析与多种功能,通过案例研究验证其有效性,并在SemEval-2020 Task 1中对比了其表示性能与现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09894 2026-08-21 cs.SE cs.MA 57%

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

确定性与LLM控制的编译流程在COBOL到Python现代化中的对比

Naing Oo Lwin, Rajesh Kumar

专题命中 工作流自动化 :agentic(abstract);分类 cs.SE

AI总结 本文通过实验对比确定性和LLM控制的编译流程,发现确定性方法在准确性、鲁棒性和效率上更优,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-08-21 cs.SE 版本更新 57%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 工作流自动化 :workflow(abstract);分类 cs.SE

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25960 2026-08-21 cs.CR cs.AI cs.RO 版本更新 57%

WaveVerif: Acoustic Side-Channel based Verification of Robotic Workflows

WaveVerif:基于声学侧信道的机器人工作流验证

Zeynep Yasemin Erdogan, Shishir Nagaraja, Chuadhry Mujeeb Ahmed, Ryan Shah

机构 * Newcastle University(新castle大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 该研究提出WaveVerif框架,利用声学侧信道分析开发机器学习验证系统,可实时低成本无源验证机器人工作流,准确率超80%且无需硬件修改。

Comments 11 pages, 3 figures, Corresponding Author: Zeynep Yasemin Erdogan (z.y.erdogan2@newcastle.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02656 2026-08-21 eess.SY cs.LG cs.SY 57%

A Reinforcement Learning-based Economic Model Predictive Control Framework for Autonomous Operation of Chemical Reactors

Khalid Alhazmi, Fahad Albalawi, S. Mani Sarathy

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

Comments This work has been submitted to Chemical Engineering Journal (CEJ) in June 2020 and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19588 2026-08-21 cs.HC 新提交 50%

Localized Ecological Momentary Assessment for Mental Health Research in China: An Implementation-Oriented Framework and Preliminary Case Application

面向中国心理健康研究的本地化生态瞬时评估:一种面向实施的框架及初步案例应用

Xinying Zhao, Yue Li, Jiafeng Wang, Yunfan Fu, Ruilin Guo, Chen Yang, Cheng Yao, Wei Deng

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究针对中国EMA平台部署的工作流程缺口,开发MEPEF框架并评估慧心EMA I,发现其核心挑战是本地化部署的工作流程缺口,为EMA平台提供了面向实施的推进路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19462 2026-08-21 cs.CR 新提交 50%

A Federated Learning Framework for Privacy-Preserving Oral Cancer Screening on Smartphones

面向智能手机隐私保护口腔癌筛查的联邦学习框架

Lena D. Swamikannan, Akshay Bhagwan Sonawane, Jay S. Patel, C. S. Mani, Lakshmi Narayana, Lakshman Tamil

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出一种实用联邦学习框架,通过Tailscale保障通信安全,采用Flower框架实现聚合,评估轻量型MobileNet系列架构,得出基于MNv4-Conv-S的全局模型在口腔癌筛查中AUC达0.929、准确率87%的最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19385 2026-08-21 cs.CV 新提交 50%

Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review

超越识别:结合候选选择分析与证据保留审核的紧凑多域阿拉伯手稿手写文本识别(HTR)

Abdullah Ahmed Ali, Mohammed Thamer Abdulhadi, Ali Haider Safaa, Dhulfiqar Mahdi Wadi

机构 * University of Technology(理工大学)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出Phoenix识别器与Athar审核工作流,通过多域适配技术提升阿拉伯手稿HTR性能,结果表明手稿HTR应作为可审计证据管理而非单纯文本替换进行评估。

Comments 13 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19350 2026-08-21 cs.HC cs.SD 新提交 50%

MultiVerse: A Creator-Centered Approach to Steering Context-Adaptive Lyrics

MultiVerse:一种以创作者为中心的引导上下文自适应歌词的方法

Alexander Wang, Chris Donahue, David Lindlbauer

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对现有媒体适配系统忽视创作者意图的问题,提出以创作者为中心的MultiVerse系统,通过规则验证实现自适应歌词创作,经10位词曲作者研究验证了其有效性与创作价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19707 2026-08-21 cs.CY quant-ph 新提交 50%

ChatGPT Solves All Tested Qiskit Homework Assignments

ChatGPT 解决所有经测试的 Qiskit 作业

Alexei Kaltchenko, Gurnivaj Tiwana

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究测试的个性化、面向执行的 Qiskit 作业设计,无法阻止 ChatGPT 成功完成,各测试实例的 ChatGPT 抗性为零,需辅以直接评估保障教育效果。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19236 2026-08-21 physics.flu-dyn 新提交 50%

Generalised Perturbed Convective Wave Theory

广义受扰对流波理论

Stefan Schoder, Eman Bagheri, Hugo Vincent, Thomas Brunner

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究将可压缩流动的受扰对流波方程(cPCWE)推广至空间变平均密度场,通过数值验证表明其在宽马赫数范围的声辐射预测精度优于Lighthill类比,可解析剪切层内的声场。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22448 2026-08-21 cs.MA 版本更新 50%

Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines

事实缺失的地方:气隙式大语言模型智能体管道中信息遗漏的分层分类和逐层归因

Santhiya Rajan, Samuel Mugel, Roman Orus

专题命中 工作流自动化 :agent(abstract)

AI总结 研究气隙式大语言模型智能体管道中信息遗漏问题,提出九层分类法、归因方法、跨架构比较框架及运行时检测框架,经多模型多引擎试验,确定遗漏率及来源,为定位运营商干预位置提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11758 2026-08-21 quant-ph 版本更新 50%

Hybrid Quantum-Classical Optimization Workflows for the Shipment Selection Problem

混合量子-经典优化工作流用于运输选择问题

Miguel Angel Lopez-Ruiz, Daiwei Zhu, Jonas Hatzenbuhler, Shudian Zhao, Claudio Girotto, Willie Aboumrad, Jonas Alm, Julia Kompalla, Mena Issler, Ananth Kaushik, Martin Roetteler

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种混合量子-经典优化方法,用于解决运输选择问题,通过量子优化框架提升物流效率,实现运输任务优化与成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08798 2026-08-21 cs.CV q-bio.QM 50%

Near-perfect photo-ID of the Hula painted frog with zero-shot deep local-feature matching

近完美照片ID的Hula彩蛙零样本深度局部特征匹配

Maayan Yesharim, R. G. Bina Perl, Uri Roll, Sarig Gafny, Eli Geffen, Yoav Ram

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究通过零样本深度局部特征匹配实现了Hula彩蛙的近完美照片ID,优于全局特征嵌入方法,提供非侵入性个体识别方案。

Comments 18 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 11 篇

2608.20195 2026-08-21 cs.SE cs.AI cs.HC 新提交 84%

From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation

从智能体行为到智能体友好型文档:关于编码智能体如何发现、阅读和编写技术文档的实证研究

Zhijun Gao, Jing Chen

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过SWE-chat和AIDev两个数据集,揭示编码智能体的文档交互规律,发现面向智能体的制品占主导,文档与代码编辑关联弱,验证序列缺失,文档滞后代码,且"智能体友好型"文档的可操作性、可验证性缺乏行为支持。

Comments 14 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19487 2026-08-21 cs.SE cs.AI cs.NE 新提交 84%

Accelerated Genetic Programming Hyper-Heuristics for Simulation-Based Scheduling via Agentic AI

基于智能体AI的仿真调度加速遗传编程超启发式算法

Heyang Thomas Li, Alexander Pletzer, Yuan Tian, Yi Mei, Mengjie Zhang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于Claude智能体AI的系统性重构方法,用于解决Python项目调度仿真代码的运行瓶颈,使运行时间大幅缩短,年节省大量核心小时与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-21 cs.SE 版本更新 77%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.SE

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19854 2026-08-21 cs.SE cs.AI 新提交 73%

Repo0: Design-Driven Zero-to-All Code Generation

Repo0:面向从零到全代码生成的设计驱动框架

Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan

专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。

Comments Our code and data are available at https://github.com/cslsolow/Repo0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 70%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20274 2026-08-21 cs.AI cs.CL 新提交 62%

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

分解与传递:大语言模型智能体的跨任务技能迁移

Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究探究LLM智能体跨任务技能迁移的可靠性,对比任务级与子任务级、文本与代码两种技能格式,提出结合特异性与抽象性的技能效用分数,发现子任务级文本技能迁移效果更优,可用于诊断技能记忆。

Comments 34 pages, 28 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19799 2026-08-21 cs.CL cs.SE 新提交 62%

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

SWE-bench Science:编码智能体能解决科学领域的工程任务吗?

Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本研究推出SWE-bench Science基准,含20个领域98个仓库的119项任务,评估发现最优智能体pass@1低于50%,揭示科学软件工程的挑战,分析四类失败机制并经消融实验明确科学知识的作用,为编码智能体研究提供测试平台。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19703 2026-08-21 cs.SE cs.AI 新提交 62%

Loreley: Repository-Scale Program Evolution with Quality-Diversity Search

Loreley:基于质量多样性搜索的仓库级程序演化

Mohan Chen

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出名为 Loreley 的 QD 方法,将完整仓库状态存入存档采样,在 Zstandard 实验中对比三种策略,发现 48 作业时 QD 未显优势但垫脚石机制生效,早期活动已产出多文件改进。

Comments 15 pages, 3 figures, 8 tables. Code and evidence: https://github.com/NeapolitanIcecream/loreley

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交 57%

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-08-21 cs.AI 版本更新 57%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: https://github.com/DEFENSE-SEU/FlowEvo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-21 cs.CY 新提交 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 57%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18305 2026-08-21 cs.CV 版本更新 50%

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

SwipeGen: 通过类人滑动合成弥合GUI代理的执行差距

Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 SwipeGen通过合成类人滑动交互提升GUI代理的执行能力,实验显示其滑动执行准确率较基线提升214%。

Comments Accepted to ACM MM 2026. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏