arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 481 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 88 篇

2608.29460 2026-09-01 cs.AI cs.CR cs.CY 新提交 70%

Can escalation channels redirect reward hacking toward defect disclosure?

升级渠道能否将奖励黑客行为转向缺陷披露?

Francesca Gomez

机构 * Wiser Human(怀瑟人类)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究评估升级渠道作为决策环境干预措施,结合反奖励黑客策略可大幅减少编码智能体的奖励黑客行为,同时提升缺陷检测覆盖率,将智能体能力转向缺陷披露而非利用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29168 2026-09-01 cs.AI 新提交 70%

JudgePanel: A Compact Judge with Panel Deliberation via Adaptive Multi-Reward Reinforcement Learning

JudgePanel:通过自适应多奖励强化学习实现面板审议的紧凑评判模型

Yiyue Qian, Shinan Zhang, Huan Song, Hannah Marlowe

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出JudgePanel框架,通过自适应多奖励强化学习为紧凑评判模型配备多智能体面板审议能力,其推理成本仅为单模型水平,在四个评估基准上性能优于700亿参数的评判专用模型,可利用数百样本快速适配新领域。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-09-01 cs.RO cs.LG cs.MA cs.SY eess.SY 版本更新 70%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-09-01 cs.CE cs.CL cs.HC 版本更新 70%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28722 2026-09-01 econ.TH cs.GT 新提交 67%

From the Social Choice Problem to a Collusion-Proof Tendering Mechanism for Dynamic Stochastic Projects

从社会选择问题到动态随机项目的防合谋招标机制

Endre Csóka

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 该文针对静态社会选择问题中 AGV 机制的缺陷,提出可转移效用保障效用机制(TU-GUM),其适用于动态随机项目且具防合谋性,还总结关联相关成果并补充新观察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31115 2026-09-01 cs.HC cs.IR 新提交 67%

InsightToast: Proactive Information Retrieval & Glanceable Visualization in the Side Channel of Data-Rich Meetings

InsightToast:数据密集型会议侧信道中的主动信息检索与概览式可视化

Mohammad Abolnejadian, Matthew Brehmer

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 该研究提出InsightToast应用,可实时监控会议对话并主动检索信息生成见解,16人对比研究显示其能帮助参与者在维持对话的同时做出明智政策决策。

Comments 16 pages, 7 figures, 2 tables. To appear in the Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29174 2026-09-01 physics.soc-ph cs.MA nlin.AO 新提交 67%

Sustained Heterogeneity: an emergent collective mechanism in LLM-driven traffic

持续异质性:大语言模型驱动交通中的一种涌现集体机制

Yujun Qi, Yangyang Guan

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本研究在LLM控制的交通中识别出持续异质性这一新兴集体机制,通过实验得出密度相关的关键LLM渗透率p_c,表明需在动力学层强制执行稳定性。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16862 2026-09-01 cs.CV cs.RO 版本更新 67%

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别

Nikolaos Stathoulopoulos, George Nikolakopoulos

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 10, pp. 11275-11282, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30271 2026-09-01 math.OC cs.AI cs.LG 新提交 62%

Dec-BFTRL: Squre-Root Regret for Decentralized Online Upper-Linearizable Optimization under Separation Access with Application to Continuous Submodular Maximization

Yiyang Lu, Mohammad Pedramfar, Vaneet Aggarwal

专题命中 多智能体 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29550 2026-09-01 cs.HC 新提交 50%

Towards Effective Generation of Interactive Visualizations with Vibe Coding: An Empirical Study

基于氛围编码的交互式可视化有效生成研究:一项实证研究

Yanshan Zeng, Ruixuan Tu, Zuo Xiang, Lijia Feng, Guozheng Li, Chi Harold Liu

专题命中 多智能体 :agent(abstract)

AI总结 本研究通过78名参与者的用户研究,系统性评估氛围编码生成交互式可视化的能力、用户体验与协作策略,为优化氛围编码实践提供了见解。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 61 篇

2509.01517 2026-09-01 cs.CY cs.AI cs.ET 92%

Agentic Workflow for Education: Concepts and Applications

Yuan-Hao Jiang, Yijie Lu, Ling Dai, Jiatong Wang, Ruijia Li, Bo Jiang

专题命中 工作流自动化 :workflow(title,abstract);agentic(title,abstract);agent(abstract);planning(abstract)

Comments Proceedings of the 33rd International Conference on Computers in Education (ICCE 2025). Asia-Pacific Society for Computers in Education

Journal ref Jiang, Y.-H., Lu, Y., Dai, L., Wang, J., Li, R., & Jiang, B. (2025). Agentic workflow for education: Concepts and applications. Proceedings of the 33rd International Conference on Computers in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30407 2026-09-01 cs.CL cs.AI cs.IR cs.LG 版本更新 90%

Exploring Autonomous Agentic Data Engineering for Model Specialization

探索用于模型专业化的自主智能体数据工程

Yujie Luo, Xiangyuan Ru, Jingsheng Zheng, Jingjing Wang, Yuqi Zhu, Jintian Zhang, Runnan Fang, Kewei Xu, Ye Liu, Zheng Wei, Jiang Bian, Zang Li, Shumin Deng

机构 * Zhejiang University(浙江大学) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 工作流自动化 :autonomous agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30976 2026-09-01 cs.LG 新提交 86%

A Human-in-the-Loop Autonomous Agent for Industry Time Series Forecasting

面向工业时间序列预测的人在回路自主智能体

Xiaoyu Tao, Mingyue Cheng, Ze Guo, Bokai Pan, Qi Liu, Shijin Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工作流自动化 :agent(title);autonomous agent(title);workflow(abstract);分类 cs.LG

AI总结 提出面向工业时间序列预测的人在回路自主系统CastClaw,整合多类资源实现预测全流程,在5个电价数据集上优于16个基线,还经电力负荷数据离线验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-09-01 cs.AI 版本更新 86%

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 工作流自动化 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28944 2026-09-01 cs.AI cs.LG 新提交 86%

Oculi: A Conversational Agentic Platform for Automated Credit Risk Analysis

Oculi:用于自动化信用风险分析的对话式智能体平台

Vennise Ho, Kristian Diana, Sandy Mourad, Milena Pilipovic, Vineel Nagisetty, Hossein Hajimirsadeghi

机构 * Royal Bank of Canada(加拿大皇家银行) RBC Borealis

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出对话式智能体平台Oculi,采用三层架构及结合确定性统计与LLM引导特征选择的细分发现流程,可自动完成信用风险分析,缩短洞察时间并保持严谨性,能发现手动探索难以处理的风险细分领域。

Comments This work was completed at Royal Bank of Canada as part of the RBC Amplify program

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29665 2026-09-01 cond-mat.mtrl-sci cs.SE 新提交 85%

Evaluating a 4B open-weights local LLM for agentic DFT workflows: a literature reproducibility audit

评估用于智能体DFT工作流的4B开放权重本地大语言模型:文献可复现性审计

Shambhu Bhandari Sharma

专题命中 工作流自动化 :agentic(title,abstract);autonomous agent(abstract);workflow(abstract);分类 cs.SE

AI总结 本研究审计4B开放权重本地大语言模型Qwen3:4B在智能体DFT工作流中的表现,发现其参数提取精度较高,完整GPU驻留提升性能,可重现部分文献的晶格常数,证明轻量开放权重模型可可靠驱动自主智能体工作流。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31006 2026-09-01 eess.SY cs.SY 新提交 85%

From Prompt to Prototype: Towards a Frontier LLM Driven RF Engineering Workflow

从提示到原型:面向前沿大语言模型驱动的射频工程工作流

Markus Heinrichs, Oscar Moschner, Simon Tewes, Volker Wienstroer, Aydin Sezgin, Rainer Kronberger

专题命中 工作流自动化 :workflow(title,abstract);agent(abstract);agentic(abstract)

AI总结 该研究开发了前沿LLM驱动的射频工程工作流,让LLM智能体自主操作多款专业EDA工具完成射频硬件设计,仅需工程师提供关键输入,拓展了LLM在专业工程领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00510 2026-09-01 cs.CL cs.AI 版本更新 84%

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

Chishui Chen, Jiaye Lin, Te Sun, Yi Yang, Junxi Wang, Cong Qin, Yangen Hu, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Peking University(北京大学)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29612 2026-09-01 cs.AI cs.DL cs.IR 新提交 83%

LLMs Interpret, Embeddings Organize, Graphs Emerge: Agent-Driven Compilation of Scientific Knowledge

大语言模型(LLMs)进行解释,嵌入(Embeddings)进行组织,图(Graphs)浮现:智能体驱动的科学知识编译

Shi-Ju Ran, Kun Zhang, Xi Wu, Liu-Si Yang, Wen-Jun Li

机构 * Capital Normal University(首都师范大学) Putian University(莆田大学)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 本研究在ASKS系统中实现智能体驱动的科学知识编译,通过LLM生成维基视图与语义、嵌入及图规则整合变更,编译56篇论文得到可追溯研究画像,图内容关联原始来源记录。

Comments 15 (main text) + 6 (SM) pages, 4 + 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28597 2026-09-01 cs.AI cs.CY 新提交 83%

The Race between Agentic AI Capabilities and Data Quality Control in Online Surveys

在线调查中智能体AI能力与数据质量控制的竞赛

Sourav Panda, Hillmer Chona, Rupak Kumar Das, Shreyash Kale, Shikha Soneji, Jonathan Dodge

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对在线调查的注意力检查防线,探究智能体AI完成调查并通过检查的能力,分析其结构漏洞并提出DOM元数据混淆的防御策略,评估相关模型以平衡不同研究者的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28590 2026-09-01 cs.AI 新提交 83%

DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation

DS-Lighting:让智能体管控框架显式化以实现数据科学自动化

Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 DS-Lighting是一款显式化数据科学自动化管控框架的工具包,将管控框架分解为四层,集成多基准实现可控比较,可提升结果的可复现性、可比性与可靠性,减少系统级故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-09-01 cs.AI 版本更新 83%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 工作流自动化 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 60 pages, added additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28790 2026-09-01 cs.MA cs.AI cs.IR cs.LG cs.SE 新提交 82%

ASTRA - Agentic System for Ticket Resolution and Analysis

ASTRA — 用于工单解决与分析的智能体系统

Shashidhar Reddy Javaji, Mohamed Trabelsi, Jin Cao, Huseyin Uzunalioglu

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出 ASTRA 智能体系统,通过协调三类专业智能体与优化循环生成证据支持的工单排查报告,在 987 个电信故障工单上取得 4.13/5.0 的平均质量得分,硬件故障诊断存在文本证据渠道的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30543 2026-09-01 cs.AI cs.SE 新提交 81%

Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis

设计一种可审计的、由大语言模型(LLM)支持的定性主题分析工作流程

Nadia Jul Jeldtoft, Tariq Yousef

机构 * University of Southern Denmark(南丹麦大学)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出一种可审计的LLM支持的定性主题分析工作流程,推导五项设计原则,构建两阶段工作流程,经半结构化丹麦访谈记录评估,其编码覆盖与人工相当,主题更紧凑,可扩展适配不同LLM与领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30727 2026-09-01 cs.CV cs.AI 新提交 79%

RailGen: Improving Railway Intrusion Detection via Agent-Guided Small-Scale Foreign Object Generation

RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测

Quan Hao, Ziyang Tao, Chenxi Zhang, Yudong Wang, Rui Shi, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29037 2026-09-01 cs.CV cs.AI 新提交 79%

DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering

DocIntent:面向真实场景文档视觉问答的可回答性引导智能体式恢复方法

Zihan Huang, Shihang Wu, Junle Liu, Peirong Zhang, Yongxin Shi, Xuhan Zheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 针对真实场景退化影响多模态大语言模型文档问答的问题,提出无需训练的DocIntent框架,通过评估可回答性、选择性调用恢复工具及比较式回滚机制,提升了各类MLLM在WildDoc基准上的表现。

Comments 25 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28708 2026-09-01 cs.SE cs.CV 新提交 79%

STEP: A Modular Silent Trial Engine for Operational Evaluation of Digital Pathology AI in Routine Workflow

STEP:用于常规工作流程中数字病理学AI操作评估的模块化静默试验引擎

Gabriele Campanella, Matthew Croken, Olga Lukatskaya, Jane Houldsworth, Ricky Kwan, Peter Schüffler, Chad Vanderbilt

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.SE

AI总结 该研究开发了模块化软件平台STEP,用于在异构环境中编排计算病理学AI的前瞻性静默试验,已部署于三家机构支持EAGLE模型评估,可减少工程重复工作量并助力AI的真实世界评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28631 2026-09-01 cs.AI cs.CE cs.CY 新提交 79%

CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science

CrossAudit:面向智能体科学的原生Git跨供应商审计循环

Zhaohe Dong, Yuhao Chen

机构 * University of Cambridge(剑桥大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.AI

AI总结 CrossAudit是面向智能体科学的原生Git跨供应商审计协议,通过不同供应商智能体按人类规则审计工作,试验显示不同供应商对规则解读有差异,其自身审计记录为核心证据。

Comments 19 pages, 4 figures, 3 tables, 22 references. Reference implementation, audit ledger, and experiment artefacts: https://github.com/dongzhaohe321418-lab/crossaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28601 2026-09-01 cs.AI 新提交 79%

Leveraging Generative AI to Design Accessible Interactive Visualizations for Undergraduate Mathematics: A Six-Phase Workflow

利用生成式人工智能为本科数学设计可访问的交互式可视化:一个六阶段工作流

Mahesh Sunkula, Kuan-Hua Chen

机构 * Purdue University(普渡大学)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本研究提出六阶段工作流,利用生成式人工智能为本科数学构建符合WCAG 2.2 AA级标准的可访问交互式可视化,无需编程,经四个工具验证,各阶段需人工验证,适用于师生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28553 2026-09-01 cs.AI cs.MA 版本更新 79%

Logos: An Agent Harness on a Cross-Process Bus

Logos:一种跨进程总线的智能体管控工具

Hanzhang Jia, Liheng Zeng, Hao Cheng, Yi Gao, Bo Ma

机构 * University of Sussex(萨塞克斯大学) Zhejiang Gongshang University(浙江工商大学) Shanghai Shuyuan Information Technology Co., Ltd.(上海数元信息技术有限公司)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 本文基于时空可组合性演算等观察构建了跨进程智能体管控工具Logos,经实验验证其可在故障场景下保障会话恢复且无重复效果,性能优于单进程架构。

Comments Still just draft, version 0.0.7

详情

展开后加载摘要…

URL PDF HTML 收藏