arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-14 至 2026-08-14 共收录 170 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 22 篇

2608.13029 2026-08-14 q-bio.GN cs.AI cs.SE 新提交 81%

Static analysis-guided agentic AI translation enables Rust as a full stack bioinformatics language

静态分析引导的智能体AI翻译使Rust成为全栈生物信息学语言

Johan Henriksson

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究结合智能体AI与静态分析,将生物信息学遗留代码翻译为Rust,在Bascet软件上实现规模、构建时间、性能的显著优化,且支持原生Windows运行,为生物信息学软件大规模重构提供了低成本方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06732 2026-08-14 cs.HC cs.LG 79%

ClimateSOM: A Visual Analysis Workflow for Climate Ensemble Datasets

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma

机构 * University of California, Davis(加州大学戴维斯分校) Scripps Institution of Oceanography, University of California, San Diego(Scripps海洋研究所,加州大学圣地亚哥分校)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13558 2026-08-14 cs.AI cs.CL 新提交 79%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

OmniScientist:一种全模态全学科的AI科学家

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 工作流自动化 :agent(abstract);autonomous agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。

Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13063 2026-08-14 cs.AI cs.CL cs.LG 新提交 67%

Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)

罕见异常失效下的解释性参与:模型行为中的渐近稀有性(或:渐近式AI)

Sam Mao

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究探究LLM在低可控失效概率工作流中,解释性参与度随失效渐近稀有性的变化,发现触发结构是关键调节变量,不同模型的异常识别与参与表现存在差异。

Comments 11 figures. Elicitation-condition sweep across three open-weight models (qwen3:8b, llama3.1:8b, mistral:7b); pipeline scripts and experimental data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12375 2026-08-14 cs.DB 新提交 67%

Pipeline Denotational Design: Correct-by-Construction Data Pipelines at Zero Cost

管道指称设计:零成本的构造正确性数据管道

Nikos Karayannidis

专题命中 工作流自动化 :agent(abstract);AI agent(abstract)

AI总结 提出管道指称设计(PDD)方法论,在设计时零成本实现数据管道构造正确性,可验证 AI 生成管道的粒度一致性,已在生产工具链中实现并评估。

Comments Extended version of a work-in-progress paper; the experimental evaluation is in progress and will appear in a later revision. Builds on a companion grain theory paper, arXiv:2601.00995

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13459 2026-08-14 cs.SE cs.AI cs.LO 新提交 62%

CAPRI: Contract-Aware Proof Repair for Isabelle

CAPRI:面向Isabelle的感知契约的证明修复

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。

Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12977 2026-08-14 cs.CR cs.AI 新提交 57%

Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents

超越手工安全:面向大语言模型智能体的自演化防御

Jiajun Ruan, Peiyang Li, Yukun Chen, Fengting Li, Chao Feng

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 针对 LLM 智能体的安全威胁,提出自演化运行时防御框架 HARD,将防御开发从人工工程转为自主演化,在保留任务效用的同时提升了安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12352 2026-08-14 cs.CY cs.AI cs.HC 新提交 57%

Why AI Governance Frameworks Are Hard to Adopt: A Role-Based Stress Test of the NIST AI RMF

为何AI治理框架难以被采用:对NIST AI RMF的基于角色的压力测试

Joseph R. Simons, David A. Broniatowski

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文通过对NIST AI RMF的基于角色的压力测试,发现AI治理框架的核心问题在于活动能否产生治理价值,角色、部署类型对治理价值有显著影响,仅当治理价值与结构适配性同时满足时才易实现风险降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13510 2026-08-14 math.ST cs.LG stat.TH 新提交 57%

On the Structural Limits of Machine Learning Decision Systems: An Information-Theoretic, Interaction-Based, and Stochastic-Dynamical Perspective

机器学习决策系统的结构极限:基于信息论、交互与随机动力学的视角

Nestor R. Barraza, Gabriel Pena

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 本研究从信息论等视角分析机器学习决策系统的结构极限,通过Fano型边界等方法推导分类与参数估计的性能极限,指出合适的数据模型是拓展预测能力的前提。

Journal ref JAIIO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09959 2026-08-14 physics.ao-ph cs.LG 版本更新 57%

AIFS-TC: A simple correction competitive with the operational frontier for tropical cyclone intensity forecasting

AIFS-TC:一种可与业务前沿水平媲美的热带气旋强度预报简单修正方法

Anna Allen, Wessel P. Bruinsma, Michael Maier-Gerber, Harrison Cook, Matthew Chantry, Richard E. Turner

专题命中 工作流自动化 :agentic(abstract);分类 cs.LG

AI总结 该研究提出AIFS-TC修正方法,基于开源AIFS-Single模型,可在12小时至7天时效内媲美业务前沿的热带气旋强度预报性能,且由Claude Fable 5自主设计,凸显智能体编码在预警系统研发中的潜力。

Comments 6 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12684 2026-08-14 cs.AR 新提交 50%

Spec-Driven Hardware Evolution via Executable Contract Refinement and Proof-Guided RTL Update

基于规约驱动的硬件演化:通过可执行契约精化与证明引导的RTL更新

Shibo Zhao, Yang Zhang, Mengxia Tao, Baoqi Zhang, Kezhi Li, Qiang Xu, Binwu Zhu, Hao Yan, Min Li

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究提出以契约为核心的规约驱动硬件演化方法,将硬件演化分为四阶段,经评估可推动遗留RTL向新版本功能收敛,为硬件版本迭代提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13044 2026-08-14 math.DS 新提交 50%

Identifiability-aware neural ordinary differential equations for parsimonious and reliable dynamic modelling

面向简约可靠动态建模的可识别性感知神经常微分方程

Núria Campo-Manzanares, Eva Balsa-Canto

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究提出iNODE框架,将实用可识别性融入神经微分方程设计,经基准测试表明其可选择紧凑架构、降低参数不确定性并提升动态建模的外推与恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12938 2026-08-14 quant-ph 新提交 50%

Encoding Circuit Satisfiability in Rydberg Atom Arrays

在里德堡原子阵列中编码电路可满足性

Haotian Ji, Zhangjie Qin, Zheng An, Bowen Yan, Daoheng Niu, Kunzhe Dai, Jingkai Fang, Dongyang Cao, Jiangyu Cui

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出CAMERA方法,在里德堡原子阵列上以远低于传统CNF编码的原子成本实现Circuit-SAT编码,验证了全加器等算术块的编码并完成端到端实例求解,为求解组合问题提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13355 2026-08-14 physics.chem-ph physics.comp-ph 新提交 50%

Evaluating Electrostatic Embedding MLIP/MM for Relative Binding Free Energy Calculations

评估用于相对结合自由能计算的静电嵌入MLIP/MM方法

Stephen E. Farr, Gianni De Fabritiis

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究将Semelak等人的静电嵌入MLIP/MM方案应用于蛋白质-配体RBFE计算,发现其可提升TYK2的RBFE精度,但在CDK2等4个靶点表现与基线相当,且单分子基准无法预测靶点依赖结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09957 2026-08-14 physics.ao-ph 版本更新 50%

Borey: A High-Resolution Regional Atmosphere-Ocean-Sea Ice-Wave Forecasting System and Hindcast Dataset for the Barents and Kara Seas

Borey:用于巴伦支海和喀拉海的高分辨率区域大气-海洋-海冰-海浪后报数据集(2019-2023)

Vasily Ivanov, Polina Verezemskaya, Alexander Gavrikov, Vitaliy Sharmar, Mikhail Krinitskiy, Timofey Grigoryev, Vladimir Vanovskiy, Evgeny Burnaev

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对巴伦支海和喀拉海的高分辨率海洋信息需求,本文提出基于WRF-NEMO-SI3-WW3模型链的Borey后报数据集,提供2019-2023年多要素场,经初步验证具备合理精度,后续将重新计算验证统计量。

Comments 12 pages, 6 figures. Initial submission; to be extended to the ver.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17565 2026-08-14 eess.SY cs.SY 版本更新 50%

Topology-Aware Propagation-Based Assessment of Extreme-Weather Impacts on Distribution System Resilience

基于拓扑感知传播的极端天气对配电系统弹性影响的评估

Junjie Yin, Xinyu Feng, Jian Han, Fangxing Li

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对极端天气给配电系统带来的不确定性和弹性挑战,提出事件条件不确定性建模和拓扑感知影响传播框架,集成多种分析评估方法,通过案例研究和平台可视化,可区分影响因素并支持预警评估。

Comments 6 pages, 8 figures, 2 tables. This paper has been accepted for presentation at the 2026 IEEE North American Power Symposium (NAPS 2026). The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03781 2026-08-14 cs.RO 版本更新 50%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 工作流自动化 :workflow(abstract)

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 12 篇

2608.13228 2026-08-14 cs.AI cs.LG 新提交 81%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交 81%

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 79%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13122 2026-08-14 cs.DC 新提交 75%

Validation-Centric AI-Assisted GPU Porting of a 250,000+ Line Legacy Weather Simulation Code

面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植

Tetsuya Hoshino, Masaya Kato, Kazuhisa Tsuboki, Daichi Mukunoki, Takahiro Katagiri, Toshihiro Hanawa

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。

Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12771 2026-08-14 cs.SE cs.AI 新提交 62%

Memorization Diagnostics for Code LLMs Should be Scale-Aware

代码大语言模型的记忆诊断应考虑规模因素

Prateek Kumar Rajput, Abdoul Aziz Bonkoungou, Alberick Euraste Djiré, Xunzhu Tang, Yewei Song, Iyiola Emmanuel Olatunji, El Hacen Diallo, Jacques Klein, Tegawendé F. Bissyandé

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对代码大语言模型记忆诊断的规模敏感性问题,通过分离表征负载与记忆,发现现有探测技术在大规模模型上失效,提出未来评估需解耦二者的方法。

Comments 26 pages, 6 figures, 6 tables. Under review at EMSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14573 2026-08-14 cs.AI cs.SE 版本更新 62%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 57%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13448 2026-08-14 cs.RO 新提交 50%

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

关注上下文:通过环境-社会解耦实现社会适配机器人动作的持续学习

Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

机构 * Utrecht University(乌得勒支大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对社交机器人在多样上下文场景下的持续学习问题,提出EDD框架解耦环境与社会知识,缓解遗忘,性能优于现有基线,相关代码已公开。

Comments Extended version of the paper accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13027 2026-08-14 cs.AR 新提交 50%

Why Do Prefetchers Fail? Let Agents Answer

预取器为何失效?让智能体来解答

Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04724 2026-08-14 cs.RO cs.CV 版本更新 50%

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations

面向全自动铁路运行的GitOps驱动标注目录

Martin Köppel, Tobias Cronauer, Zekiye Ilknur-Öz, Sebastian Dubiel, Patrick Naumann, Philipp Neumaier

专题命中 软件智能体 :workflow(abstract)

AI总结 针对全自动铁路运行的标注数据管理难题,提出基于GitOps的轻量级元数据管理架构,结合Data-as-Code、CI/CD与SSG,实现以开发者为中心的工作流,保障可追溯性与合规性并自动生成数据集概览。

Journal ref 16th International Conference on Advanced Computer Information Technologies in Zlín, Czech Republic, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29545 2026-08-14 cs.CY cs.CR 版本更新 50%

Stand-Alone Complex or Vibercrime? Exploring the adoption and innovation of GenAI tools, coding assistants, and agents within cybercrime ecosystems

独立复杂或维伯犯罪?探索生成AI工具、编码助手和代理在网络犯罪生态系统中的采用与创新

Jack Hughes, Ben Collier, Daniel R. Thomas

专题命中 软件智能体 :agentic(abstract)

AI总结 本文通过创新理论和演化经济学分析网络犯罪生态系统,提出独立复杂和维伯犯罪概念,发现AI在现有低利润方案中有早期应用,但未造成广泛破坏。

Comments Updated with results on developments in the first half of 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 1 篇

2511.06990 2026-08-14 eess.SY cs.SY 50%

Koopman-Based Dynamic Environment Prediction for Safe UAV Navigation

Vitor Bueno, Ali Azarbahram, Marcello Farina, Lorenzo Fagiano

专题命中 GUI与网页智能体 :planning(abstract)

Journal ref 2026 European Control Conference (ECC), IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏