arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-26 至 2026-08-26 共收录 29 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 29 篇

2608.24650 2026-08-26 cs.AR cs.AI 新提交 87%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-26 cs.CL 版本更新 85%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jiahao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 工作流自动化 :workflow(title,abstract);agent(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交 83%

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23642 2026-08-26 cs.AI cs.HC 新提交 83%

AI Agents Push Humans Out of the Loop

AI智能体将人类排除在控制回路之外

Margaret Mitchell, Avijit Ghosh, Samir Passi

机构 * Hugging Face Data & Society

专题命中 工作流自动化 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对AI智能体自主性提升带来的人类监督退化问题,该研究提出需同等重视监督者需求与AI能力,结合自动化和人机交互设计方案以抵消技能萎缩,呼吁开发者采用相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24314 2026-08-26 cs.AI cs.ET 新提交 79%

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

用于语音智能体评估的LLM评判基准:可靠性、校准与人工监督

Anupam Purwar, Shashank Singh, Kritika Srivastava

机构 * Sprinklr AI

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 本研究对比人工与GPT-4.1、GPT-5对电信和零售语音智能体对话的评估,发现LLM评估可靠性依赖指标与配置,可作为规模化评估组成部分,支持混合评估 pipeline。

Comments Extends LLM-as-a-Judge to voice agents across telecom and retail, testing GPT-4.1 and GPT-5 against human raters across 10 safety and efficiency metrics. A correlation-based calibration analysis reveals domain-dependent reliability and identifies Recovery Turn Count and safety-recall metrics as unreliable for fully automated judging

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23610 2026-08-26 cs.SE 新提交 79%

From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering

从可追溯性到可辩护性:智能体软件工程中的问责结构

Rashid Azarang

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.SE

AI总结 本研究通过对47个平台的文档调查和30个仓库的工具分析,发现智能体软件工程领域的记录缺乏可辩护性,存在可验证性漏洞,仅少数采用证明工具的仓库实现了端到端绑定。

Comments 18 pages, 2 figures. Primary-data measurement study: a 47-platform two-pass graded documentation survey and a 30-repository depth measurement; not a literature survey. Replication package: this https URL (https://github.com/mentu-ai/from-traceability-to-justifiability)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24496 2026-08-26 cs.NI 新提交 78%

A Capability Broker for Workflow-Network QoS Coordination in B5G/6G Industrial Services

面向B5G/6G工业服务中工作流-网络QoS协调的能力代理

Qize Guo, Yan Chen, Taleb Tarik, Bjoern Riemer, Hemant Zope, Hao Yu

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 针对B5G/6G工业服务中工作流与网络QoS协调缺失的问题,提出Capability Broker代理并验证其可保障承诺一致性且开销低,解决了现有功能的协调缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20488 2026-08-26 cs.LG 版本更新 74%

Metag: A dataset to build agentic meta-reviewing capabilities

Metag:用于构建智能体元评审能力的数据集

Anirudh Sundar, Min Chen, Divya Tadimeti, Gemma Zhang, Xinyi Alice Li, Nigel Boachie Kumankumah, Pavan Uttej Ravva, Sadid Hasan, Somya Chatterjee, Pruthvi Prakash Navada, Xiao Wang, Yue Kang, Sulaiman Vesal, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软公司)

专题命中 工作流自动化 :agentic(title);分类 cs.LG

AI总结 本文推出Metag数据集,用于构建元评审智能体,助力元评审员快速确认作者对评审意见的回应及变更位置,提升同行评审透明度与可追溯性。

Comments 23 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24004 2026-08-26 cs.CL 新提交 70%

AgentSpec: Speculative Decoding for Batch Inference of LLM Agents

AgentSpec:面向大语言模型智能体批量推理的推测解码算法

Xin Wang, Ziming Miao, Yi Zhu, Hui Shen, Zhongwei Wan, Fan Yang, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院) University of Michigan(密歇根大学)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 针对LLM智能体批量推理响应慢的问题,本研究提出AgentSpec推测解码算法,通过结构隔离的draft机制和感知冗余的预算分配提升效率,在多工作负载与模型上验证其性能优于现有最优方法。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23867 2026-08-26 cs.MA cs.CL 新提交 70%

Markets, Not Planners: Decentralized Orchestration of LLM Agents with Private Information

市场而非规划者:利用私有信息对大语言模型智能体进行去中心化协调

Xiao Liu, Haoyang Li, Songwei Li, Hongbo Fang, Fengli Xu, Feng Shi, James Evans

专题命中 工作流自动化 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 针对中心化LLM智能体协调的瓶颈与易操控问题,提出去中心化的AgentLance重复劳动力市场机制,经多类任务验证,其匹配专长、转向廉价智能体的表现优于基线方法,还可通过修正市场失灵进一步提升效率。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14905 2026-08-26 cs.CL 版本更新 70%

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

智能体在自动研究(AutoResearch)中如何失败?针对100项真实前沿研究任务的端到端诊断评估

Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li, Rahul Thapa, Madalina Ciobanu, Navan Preet Singh, Qingqing Mao, Ritankar Das

专题命中 工作流自动化 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究推出AutoResearchEval评估平台,构建含45种失效模式的ARFT分类体系,发现当前智能体缺乏元认知循环是核心缺陷,公开发布相关资源以推动自主科学发现研究。

Comments *Equal Contribution (alphabetical order by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24842 2026-08-26 cs.CL cs.AI 新提交 62%

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

阅读并非使用:检索、判断与AI金融研究工作流的设计

Miao Liu, Zhizhe Liu

机构 * Carroll School of Management, Boston College(波士顿学院卡罗尔管理学院) Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对长上下文金融分析中存在的检索-整合缺口,通过实验发现工作流架构会影响LLMs将检索到的风险披露信息整合至投资判断的效果,指出AI分析师表现由模型能力与工作流架构共同决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23791 2026-08-26 eess.AS cs.AI 新提交 57%

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

EmoTra-TTS:用于语音合成的流畅句内情感转换

Tianchi Liu, Zeyang Song, Tianrui Wang, Zhipeng Li, Chenglin Xu, Yiwen Guo

专题命中 工作流自动化 :planning(abstract);分类 cs.AI

AI总结 EmoTra-TTS针对现有情感TTS系统与情感时间特性不匹配的问题,采用多遍流混合管道、双阶段VAD条件及方向-幅度解耦注入,实现流畅句内情感转换,且性能优于SOTA基线与商业系统。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23922 2026-08-26 cs.AI stat.ML 新提交 57%

Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining

数据混合作为混合实验:大语言模型预训练的响应面方法与最优设计

Yicheng Mao, Hongru Du

机构 * University of Calgary(卡尔加里大学) University of Virginia(弗吉尼亚大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本研究将LLM预训练的数据混合视为混合实验,采用Scheffé响应面模型构建模型鲁棒的$\boldsymbol{\textit{I}}$-最优设计,可解释混合响应并提升代理实验效率,验证了其统计优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23643 2026-08-26 cs.AI 新提交 57%

FLARE: A Systematic, Uncertainty-Aware Framework for Evidence-Based Adoption of Artificial Intelligence in Healthcare

FLARE:一种用于循证采用医疗人工智能的系统性不确定性感知框架

Jacob Idoko, Siddhartha Paudel, Mariana Bento, Roberto Souza, Gouri Ginde

机构 * University of Calgary(卡尔加里大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本研究提出FLARE框架,结合模糊逻辑等方法评估医疗AI采用的财务与运营影响,经案例研究验证其可量化成本与节约额,确定盈亏平衡点,为医疗AI部署决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交 57%

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23614 2026-08-26 cs.SE 新提交 57%

SDR Driver for Precise Timing Applications

用于精密授时应用的SDR驱动程序

Fabrizio Pollastri

专题命中 工作流自动化 :workflow(abstract);分类 cs.SE

AI总结 本文开发了用于HackRF One SDR的精密授时应用驱动,采用AI辅助开发从现有代码生成SoapySDR兼容驱动,大幅减少开发工作量并提升可维护性。

Comments 5 pages, 3 figures, 2 tables, submitted to GRCon26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23750 2026-08-26 hep-ph cs.LG nucl-th 新提交 57%

S-matrix informed neural networks for amplitude analysis

用于振幅分析的S矩阵引导神经网络

Wyatt A. Smith, Arkaitz Rodas, Marius D. Thomas, César Fernández-Ramírez, Giorgio Foti, Lin Qiu, Adam P. Szczepaniak, Alessandro Pilloni

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 针对粒子物理中从有限含噪且不一致测量重构散射振幅的问题,提出S矩阵引导神经网络(SINNs),结合数据选择与不确定性量化,成功应用于ππ散射,结果可靠且可迁移。

Comments 29 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20539 2026-08-26 cs.CY cs.AI cs.HC 版本更新 57%

ExploraTwin, a Non-Profit Research Platform for Digital Twin Simulations

ExploraTwin:一个用于数字孪生模拟的非营利研究平台

Naveen Venkat, Yuchen Qiu, Tianyi Peng, George Gui, Olivier Toubia

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本研究推出非营利数字孪生模拟平台ExploraTwin,支持调查与小组模式,开发了标准化数据格式CroissantTwin,复现数据集实验验证其调查执行保真度达99.6%,降低了相关研究的测试部署门槛。

Comments 44 pages (32-page manuscript plus web appendix), 8 figures. Platform: this https URL (https://exploratwin.org)

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.08773 2026-08-26 cs.LG stat.ML 版本更新 57%

Opponent Aware Reinforcement Learning

感知对手的强化学习

Victor Gallego, Roi Naveiro, David Rios Insua, David Gomez-Ullate Oteiza

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 该研究针对存在干扰奖励过程的对手的强化学习场景,提出TMDPs框架及对应学习方法,经实验验证对抗感知对RL智能体的重要性。

Comments Accepted to the European Journal of Operational Research, available at this https URL (https://www.sciencedirect.com/science/article/pii/S0377221726007150)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23821 2026-08-26 q-bio.QM 新提交 50%

Finch: Toxicity Dose Response Curve Prediction of Chemical Compounds and Mixtures

Finch:化学化合物及混合物的毒性剂量反应曲线预测

Abdullah Shouaib, John Zapanta, Sean P. Davern, Samuel Dixon, Zachary R. Stromberg, Becky Hess, Sydney Schwartz, C Mark Maupin

专题命中 工作流自动化 :workflow(abstract)

AI总结 Finch整合多任务定量构效关系模型,解决传统混合物模型的局限,实现化学化合物及混合物的毒性剂量反应曲线预测,助力监管安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24594 2026-08-26 cs.CV 新提交 50%

Comparative Assessment of Deep Learning Architectures for Underwater Subsurface Kelp Forest Segmentation with The Kelp-o-Tron

用于水下海底海带林分割的深度学习架构比较评估(基于Kelp-o-Tron)

Sundarabalan Balasubramanian, César Borja, Ana C. Murillo, Lexi N. Wilkes, Meredith L. McPherson, Kira A. Krumhansl, Jennifer A. Dijkstra, Jarrett E. K. Byrnes

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究评估三种深度学习分割框架对水下海带林的分割性能,发现ResNet50-DeepLabV3(即Kelp-O-Tron)在准确率、鲁棒性和泛化性上表现最优,相关资源可用于水下生境制图与生态监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23852 2026-08-26 cs.HC 新提交 50%

ColorA11Y: Enhancing Creative Design Workflows with Just-in-Time Color Accessibility Recommendations

ColorA11Y:利用即时色彩无障碍建议优化创意设计工作流

Alexa Siu, Rajiv Jain, Abhinav Kannan, Jose Echevarria, Mary Ann (MJ) Jawili, Yalpi Shiva Prasad, Rick Treitman, Garreth W. Tigwell, Jonathan Lazar

专题命中 工作流自动化 :workflow(abstract)

AI总结 ColorA11Y系统在设计创作全程提供即时色彩无障碍建议,经用户研究验证可优化工作流,推进将无障碍考量融入创意过程的原生设计方法。

Comments To appear in ASSETS '26: The 28th International ACM SIGACCESS Conference on Computers and Accessibility (October 25-28, 2026, Vila Nova de Gaia, Portugal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23760 2026-08-26 cs.DL 新提交 50%

Towards a Definition of the Computational Architecture of Open Scholarly Infrastructures

面向开放学术基础设施的计算架构定义

Ivan Heibi, Mario Petrella, Angelo Di Iorio, Silvio Peroni

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出分层框架定义开放学术基础设施(OSI)计算单元架构,结合开放引文实际案例,为OSI计算模块设计提供实用参考与方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23707 2026-08-26 quant-ph cond-mat.other 新提交 50%

Hamiltonian Learning at Scale

大规模哈密顿学习

Nathan Johnson, Eugene Dumitrescu

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究利用张量网络技术规模化含噪声的哈密顿学习,给出误差解析界并模拟验证其稳定性,实现N=300自旋链的混合场伊辛模型哈密顿量学习,为相关实验提供经验。

Comments 7 pages, 3 figures, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23717 2026-08-26 astro-ph.EP astro-ph.IM physics.space-ph 新提交 50%

GravDyn: A Python Framework for Gravitational Modeling of Irregular Celestial Bodies Using Polyhedral, mascon, and Series Expansion Methods

GravDyn:用于非规则天体引力建模的Python框架,采用多面体、质量集中块(mascon)及级数展开方法

Safwan Aljbaae, valerio Carruba, Allan K. de Almeida Jr, Gabriel Antonio Caritá, Antonio F. B. A. Prado, Marcelo L. Mota, Carlos E. Ferreira Lopes

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究提出开源Python框架GravDyn,整合三种引力建模方法,可高效计算非规则天体的引力势与加速度,适用于小天体相关的航天任务设计与轨道研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12990 2026-08-26 quant-ph q-fin.CP 版本更新 50%

A Noise-Aware Quantum Algorithm for Credit Valuation Adjustments on Real Quantum Hardware

一种用于实际量子硬件上信用估值调整的噪声感知量子算法

Guillem Borràs Espert, Francisco Gómez Casanova, Luis de Pedro Sánchez, Senaida Hernández Santana, Pablo Serrano Molinero

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究针对信用估值调整问题,开发端到端噪声感知量子工作流程,引入对比感知贝叶斯迭代量子幅度估计,经硬件校准实验验证其有效性,能更有效利用设备放大能力,降低经典后处理运行时间,并分解CVA误差。

Comments 56 pages, 14 figures, 18 tables. Includes supplementary appendices with implementation details, extended results, calibration data, and quantum-resource analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09064 2026-08-26 stat.AP 版本更新 50%

Bayesian decision theory for wildlife management under uncertainty: from inference to action

贝叶斯决策理论在不确定性下的野生动物管理中的应用:从推断到行动

Olivier Gimenez, Abigail G. Keller, Cyril Milleret

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于贝叶斯决策理论的实用工作流程,通过两个案例展示如何在不确定性下平衡生态、经济和社会目标,提升管理决策的透明度和可重复性。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏