arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-26 至 2026-08-26 共收录 235 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 29 篇

2608.23821 2026-08-26 q-bio.QM 新提交 50%

Finch: Toxicity Dose Response Curve Prediction of Chemical Compounds and Mixtures

Finch:化学化合物及混合物的毒性剂量反应曲线预测

Abdullah Shouaib, John Zapanta, Sean P. Davern, Samuel Dixon, Zachary R. Stromberg, Becky Hess, Sydney Schwartz, C Mark Maupin

专题命中 工作流自动化 :workflow(abstract)

AI总结 Finch整合多任务定量构效关系模型,解决传统混合物模型的局限,实现化学化合物及混合物的毒性剂量反应曲线预测,助力监管安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24594 2026-08-26 cs.CV 新提交 50%

Comparative Assessment of Deep Learning Architectures for Underwater Subsurface Kelp Forest Segmentation with The Kelp-o-Tron

用于水下海底海带林分割的深度学习架构比较评估(基于Kelp-o-Tron)

Sundarabalan Balasubramanian, César Borja, Ana C. Murillo, Lexi N. Wilkes, Meredith L. McPherson, Kira A. Krumhansl, Jennifer A. Dijkstra, Jarrett E. K. Byrnes

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究评估三种深度学习分割框架对水下海带林的分割性能,发现ResNet50-DeepLabV3(即Kelp-O-Tron)在准确率、鲁棒性和泛化性上表现最优,相关资源可用于水下生境制图与生态监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23852 2026-08-26 cs.HC 新提交 50%

ColorA11Y: Enhancing Creative Design Workflows with Just-in-Time Color Accessibility Recommendations

ColorA11Y:利用即时色彩无障碍建议优化创意设计工作流

Alexa Siu, Rajiv Jain, Abhinav Kannan, Jose Echevarria, Mary Ann, Jawili, Yalpi Shiva Prasad, Rick Treitman, Garreth W. Tigwell, Jonathan Lazar

专题命中 工作流自动化 :workflow(abstract)

AI总结 ColorA11Y系统在设计创作全程提供即时色彩无障碍建议,经用户研究验证可优化工作流,推进将无障碍考量融入创意过程的原生设计方法。

Comments To appear in ASSETS '26: The 28th International ACM SIGACCESS Conference on Computers and Accessibility (October 25-28, 2026, Vila Nova de Gaia, Portugal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23760 2026-08-26 cs.DL 新提交 50%

Towards a Definition of the Computational Architecture of Open Scholarly Infrastructures

面向开放学术基础设施的计算架构定义

Ivan Heibi, Mario Petrella, Angelo Di Iorio, Silvio Peroni

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出分层框架定义开放学术基础设施(OSI)计算单元架构,结合开放引文实际案例,为OSI计算模块设计提供实用参考与方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23707 2026-08-26 quant-ph cond-mat.other 新提交 50%

Hamiltonian Learning at Scale

大规模哈密顿学习

Nathan Johnson, Eugene Dumitrescu

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究利用张量网络技术规模化含噪声的哈密顿学习,给出误差解析界并模拟验证其稳定性,实现N=300自旋链的混合场伊辛模型哈密顿量学习,为相关实验提供经验。

Comments 7 pages, 3 figures, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23717 2026-08-26 astro-ph.EP astro-ph.IM physics.space-ph 新提交 50%

GravDyn: A Python Framework for Gravitational Modeling of Irregular Celestial Bodies Using Polyhedral, mascon, and Series Expansion Methods

GravDyn:用于非规则天体引力建模的Python框架,采用多面体、质量集中块(mascon)及级数展开方法

Safwan Aljbaae, valerio Carruba, Allan K. de Almeida, Gabriel Antonio Caritá, Antonio F. B. A. Prado, Marcelo L. Mota, Carlos E. Ferreira Lopes

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究提出开源Python框架GravDyn,整合三种引力建模方法,可高效计算非规则天体的引力势与加速度,适用于小天体相关的航天任务设计与轨道研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12990 2026-08-26 quant-ph q-fin.CP 版本更新 50%

A Noise-Aware Quantum Algorithm for Credit Valuation Adjustments on Real Quantum Hardware

一种用于实际量子硬件上信用估值调整的噪声感知量子算法

Guillem Borràs Espert, Francisco Gómez Casanova, Luis de Pedro Sánchez, Senaida Hernández Santana, Pablo Serrano Molinero

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究针对信用估值调整问题,开发端到端噪声感知量子工作流程,引入对比感知贝叶斯迭代量子幅度估计,经硬件校准实验验证其有效性,能更有效利用设备放大能力,降低经典后处理运行时间,并分解CVA误差。

Comments 56 pages, 14 figures, 18 tables. Includes supplementary appendices with implementation details, extended results, calibration data, and quantum-resource analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09064 2026-08-26 stat.AP 版本更新 50%

Bayesian decision theory for wildlife management under uncertainty: from inference to action

贝叶斯决策理论在不确定性下的野生动物管理中的应用:从推断到行动

Olivier Gimenez, Abigail G. Keller, Cyril Milleret

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于贝叶斯决策理论的实用工作流程,通过两个案例展示如何在不确定性下平衡生态、经济和社会目标,提升管理决策的透明度和可重复性。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 13 篇

2608.23653 2026-08-26 cs.SE cs.AI 新提交 90%

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

超越可执行模型:用于物理系统建模的Pufibara智能体框架与Modelica智能体工作流基准

Zizhe Wang

专题命中 软件智能体 :agent(title,abstract);workflow(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对物理系统建模中智能体的状态管理与证据关联问题,提出Pufibara智能体框架,并构建含232个任务的基准,实验显示其在任务成功率与资源效率上优于Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23602 2026-08-26 cs.AR 新提交 85%

PACT: Post-route Agentic Checkpoint Tuning for FPGA Timing Closure

PACT:面向FPGA时序收敛的后路由代理检查点调优

Huan Lin, Kunlong Li, Lingli Wang, Zhiang Zhang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn)

AI总结 本文提出PACT框架,用于Vivado设计检查点的后路由调优,在35个UltraScale+检查点上将F_max几何平均提升22.30%,速度较DATuner快6.4倍,令牌成本仅0.16美元/ DCP。

Comments Accepted to the 2026 International Conference on Field-Programmable Technology (FPT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06752 2026-08-26 cs.SE 版本更新 83%

Pomona: Continuous Code Quality Improvement via Small, Agentic Pull Requests at Bloomberg

Pomona:通过小型自动化变更实现彭博社的持续代码质量改进

David Williams, Angelos Evripiotis, Serkan Kirbas, Harry Morgan, Sergey Magidovich, Peter Wainwright, Federica Sarro

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。

Comments 6 pages, 2 figures, 1 table, camera-ready version accepted for the Industry Track at ISSRE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10673 2026-08-26 cs.IR 版本更新 82%

Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation

打破以用户为中心的代理:一个三方框架用于基于代理的推荐

Yaxin Gong, Chongming Gao, Chenxiao Fan, Haoyan Liu, Wenjie Wang, Jianshan Sun, Yangyang Li, Fuli Feng, Xiangnan He

专题命中 软件智能体 :agent(title,abstract);agentic(abstract)

AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 81%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 软件智能体 :agent(title);agentic(abstract);分类 cs.CL、cs.SE

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-08-26 cs.CV cs.RO eess.IV 版本更新 78%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Embodied Intelligent Robotics

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :autonomous agent(title,abstract)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24291 2026-08-26 cs.AI cs.SE 新提交 73%

ReproAgent: Contract-Guided Paper-to-Code Reproduction

ReproAgent:基于合约引导的论文到代码复现

Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Minzu University of China(中央民族大学) Zhongguancun Academy(中关村科学院)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 ReproAgent是基于合约引导的四阶段论文到代码复现流水线,在PaperBench Code-Dev基准上,其在两种骨干模型的同架构支架中取得最高平均得分,相关产物已公开。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24188 2026-08-26 cs.AI cs.CL cs.LG cs.SE 新提交 70%

Paritok-4B: Intent-Conditioned Context Compression for Coding Agents

Paritok-4B:面向编码智能体的意图条件上下文压缩模型

Jiayu Shi, Luzhuo Chen

机构 * Paritok

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对编码智能体上下文占比过高的问题,提出意图条件抽取式压缩模型 Paritok-4B,在 SWE-bench Lite 上实现高压缩率的同时,未显著降低求解率,且成本更低、可自托管。

Comments 20 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12202 2026-08-26 cs.PL cs.AI cs.CR cs.LG 版本更新 62%

Quasar: A Programming Language Specialized for LLM Code Actions

Quasar:一种专门用于LLM代码操作的编程语言

Stephen Mell, Botong Zhang, David Mell, Shuo Li, Ramya Ramalingam, Nathan Yu, Stephan Zdancewic, Osbert Bastani

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。

Journal ref Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24747 2026-08-26 cs.CL 新提交 57%

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:为强化学习智能体演化可验证技能

Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24358 2026-08-26 cs.AI 新提交 57%

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

交接代价:在大语言模型智能体中延续非原生轨迹

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)

专题命中 软件智能体 :tool use(abstract);分类 cs.AI

AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23754 2026-08-26 cs.SE 新提交 57%

Enhancing Bug Report Templates in the TianoCore UEFI Firmware Development Community

增强TianoCore UEFI固件开发社区中的漏洞报告模板

Laura Baird, Neelesh Reddybattula, Nazanin Siavash, Terrance E. Boult, Armin Moin

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 本研究针对TianoCore核心项目EDK II,通过分析漏洞数据发现关键信息缺失问题,拟在GitHub Issues的漏洞报告模板中新增字段,计划经开发者反馈调整及A/B测试验证,以优化UEFI固件漏洞分类与解决流程。

Comments ACM International Workshop on Firmware Testing and Analysis (FTA) 2026, Co-located with ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13027 2026-08-26 cs.AR 版本更新 50%

Why Do Prefetchers Fail? Let Agents Answer

预取器为何失效?让智能体来解答

Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。

Comments Fixed a minor typo in Fig. 4

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 9 篇

2608.23035 2026-08-26 cs.AI 版本更新 81%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24017 2026-08-26 cs.CR cs.AI 新提交 70%

WebMCP-Phalanx: Enforcing and Characterizing Trust Boundaries for Browser-Integrated LLM Agents

WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界

Lin-Fa Lee, YI-YU Chang, Kuo-Hui Yeh

专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。

Comments 8 pages, 1 figure, AAAI2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24204 2026-08-26 cs.NI 新提交 67%

WiCi: Wireless GPU Computing Infrastructure

WiCi:无线GPU计算基础设施

Yibin Shen, Wei Li, Kaiqiang Xu, Zili Meng

专题命中 GUI与网页智能体 :agentic(abstract,abstract_cn)

AI总结 针对移动设备本地推理性能不足、云端推理成本高的问题,本文提出WiCi无线GPU计算基础设施,可让移动设备通过WiFi接入服务器级GPU,大幅提升推理性能并支持更大模型,性能接近服务器级GPU原生表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交 57%

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24764 2026-08-26 cs.AI 新提交 57%

Evidence Blindness in Direct Corpus Interaction: Persistent Navigation with AtlasNav

直接语料库交互中的证据失明:基于AtlasNav的持久导航

Hongyu Guo, Zhiyu Zheng, Zhao Cao

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 针对直接语料库交互中存在的证据失明问题,提出AtlasNav框架,通过一次性构建语料库图谱实现自适应导航,在BrowseComp-Plus等数据集上提升了准确率并降低了推理成本。

Comments 27 pages, 7 figures. Code, data, and trajectories will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24749 2026-08-26 cs.SE 新提交 57%

From Natural Language Requirements to Graphical User Interfaces: Automated Prototyping and Verification with Pretrained Language Models

从自然语言需求到图形用户界面:基于预训练语言模型的自动原型设计与验证

Kristian Kolthoff

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE

AI总结 本研究针对将自然语言需求转化为GUI原型及GUI应用需求验证的两大挑战,提出基于预训练语言模型的自动化方法,可显著减少相关手动工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24099 2026-08-26 cs.AI 新提交 57%

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Android GUI智能体对运行时异常是否具备鲁棒性?AnTrap:在动态对抗环境中评估智能体

Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu, Hong Zhou

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Chinese Academy of Sciences(中国科学院大学) Tongji University(同济大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本研究针对Android GUI智能体抗运行时异常鲁棒性不足的问题,提出AnTrap基准评估框架,发现16款领先GUI模型普遍受动态异常影响,且深度上下文陷阱暴露模型内在局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-26 cs.RO cs.AI cs.CV 版本更新 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables, Code is available at: [https://github.com/XuPeng23/AeroDPO]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02519 2026-08-26 cs.RO 版本更新 50%

IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes?

IMAC-AgriVLN:农业视觉与语言导航智能体能否意识到指令错误?

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学) China Agricultural University-Sichuan Advanced Agricultural & Industrial Institute(中国农业大学-四川先进农业与工业研究院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业VLN中指令可能错误的问题,提出A2A-MI基准和IMAC模块,通过分析指令与前方图像判断并纠正错误,显著提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏