arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-14 至 2026-08-14 共收录 170 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 48 篇

2608.12915 2026-08-14 cs.DC cs.AI 新提交 74%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 74%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13331 2026-08-14 cs.LG cs.AI 新提交 73%

Training AI Scientists to Replicate Research

训练AI科学家以实现研究的可复现性

Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes

机构 * Inherent(因赫伦特)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。

Comments 47 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13511 2026-08-14 cs.RO 新提交 71%

A Browser-Native Digital Test Range for Benchmarking 4D Ocean-Glider Planning Algorithms

用于基准测试4D水下滑翔机规划算法的浏览器原生数字测试场

Edward Holmberg, Elias Ioup, Mahdi Abdelguerfi

机构 * LSU(路易斯安那州立大学) U.S. Naval Research Lab(美国海军研究实验室)

专题命中 规划决策 :planning(title)

AI总结 本研究提出一种浏览器原生数字测试场,用于基准测试4D水下滑翔机规划算法,通过OSSE实验评估了五种经典规划器,为水下滑翔机预部署实验提供了可复现的科学追溯操作空间。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 67%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00570 2026-08-14 cs.NI 67%

Beyond Per-Request QoS: Coordinating Industrial Workflows with B5G/6G Network Capabilities

超越每请求服务质量:协调工业工作流与B5G/6G网络能力

Qize Guo, Bjoern Riemer, Tarik Taleb, Yan Chen, Hao Yu, Hemant Zope

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出一种能力感知协调框架,通过网络可持续支持的QoS配置与工业工作流相映射,提升服务连续性和负载下工作流完成率。

Comments 7 pagers, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20936 2026-08-14 physics.soc-ph nlin.AO 版本更新 67%

Empathy Modeling in Active Inference Agents for Perspective-Taking and Alignment

主动推断代理中的共情建模:用于视角转换与对齐

Mahault Albarracin, Hongju Pae, Philip Wilson, Anna Mikeda, Alejandro Jimenez-Rodriguez, Sanjeev V. Namjoshi, Harshil Shah

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 该研究提出了一种基于主动推断的共情框架,通过视角转换实现稳定合作,揭示了共情结构对社会协调的关键作用。

Comments Code and data: https://doi.org/10.5281/zenodo.21908008

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 66%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL;planning(journal_ref)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 62%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13428 2026-08-14 cs.AI 新提交 57%

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

RAIL:一种人工智能就绪水平的自动分类器

Juan Irving Vasquez, Juan Terven, Laura-Ivoone Garay-Jimenez

机构 * CIETEC-IPN Instituto Politécnico Nacional(墨西哥国立理工学院) CICATA-QRO UPIITA

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出RAIL分类器,将三类AI就绪框架统一为AIRL量表,通过大语言模型智能体小组裁决实现自动评估,测试显示其一致性好且避免高估。

Comments Under review at journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13417 2026-08-14 cs.AI 新提交 57%

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

超越最终得分:面向长期人工智能研究与开发的智能体系统评估

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 本文通过新框架评估7个前沿模型在36项长期任务上的表现,发现当前智能体更像工程优化器,方案多基于已有技术,为模型训练等环节改进指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13415 2026-08-14 cs.RO cs.AI 新提交 57%

Deliberate Practice: Learning Robot Skills under a Budget

刻意练习:有限预算下的机器人技能学习

Shivam Vats, Sudarshan Harithas, Mete Tuluhan Akbulut, Arvind Raghunathan, George Konidaris

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究有限预算下机器人序列任务技能学习问题,提出刻意练习算法,通过双线性规划计算预算最优分配,经仿真与真实实验验证可提升机器人长程规划能力。

Comments 16 pages including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13179 2026-08-14 cs.AI 新提交 57%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 规划决策 :tool-use(abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12851 2026-08-14 cs.AI 新提交 57%

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

熟能生险:自我改进的大语言模型智能体中的技能误演化

Xutao Mao, Liangjie Zhao, Xiang Zheng, Cong Wang

机构 * Adelaide University(阿德莱德大学) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对自我改进LLM智能体的技能误演化问题,构建SkillMisevo-Gym与SkillMisevo-Bench基准,提出SafeEvolve方法,可显著降低不安全检索与新会话危害,同时对良性效用影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12548 2026-08-14 cs.HC cs.LG eess.SP 新提交 57%

Analysis of Motor Signatures of Social Adaptation in Autism for Efficient Human-Centric Systems

自闭症社会适应的运动特征分析——面向高效的以人为中心的系统

Lara Pereira, Teresa Sousa, Miguel Castelo-Branco, João Ruivo Paulo

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究通过分析舞蹈模仿任务的运动数据,提出SCSI指数,以79.2%的平衡准确率区分自闭症与神经典型成人,发现社会情境敏感性可作为自闭症运动行为的生物标志物,为开发包容性以人为中心技术提供支撑。

Comments Accepted at IEEE SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11110 2026-08-14 cs.CL 版本更新 57%

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

行动胜于言语:测量使用工具的智能体的跨语言策略保留率

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 该研究测量使用工具的智能体的跨语言行动策略保留率,发现前沿模型在贪心解码下保留71%-73%策略,参数低于100亿时保留率崩溃,且存在影响测量的混淆因素。

Comments Accepted in COLM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12641 2026-08-14 stat.ME 新提交 50%

Empirical Simulation of Survival and Mixed-Type Data for Clinical Trial Design

临床试验设计用生存数据与混合类型数据的经验模拟

Yao Chen, Jiren Sun, Yuxin Ding, Yushi Liu, Yongming Qu

专题命中 规划决策 :planning(abstract)

AI总结 本研究提出基于经验Copula的R包EmpiricalSim,用于模拟含多类型变量的多元生存数据,可匹配目标生存分布并保留变量间相关性,在肿瘤临床试验数据重建中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13395 2026-08-14 cs.RO 新提交 50%

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 50%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 规划决策 :planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12857 2026-08-14 cs.HC 新提交 50%

PolyPresentation: A Multimodal AI Platform for Slide-Aware Iterative Presentation Practice

PolyPresentation:一种面向幻灯片感知迭代演示练习的多模态AI平台

Chen Chen, Jihao Li, Zhiyuan Wen, Tianhui Zhang, Di Zou, Jiannong Cao

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对现有AI演示排练工具缺乏幻灯片关联与迭代练习规划支持的问题,推出PolyPresentation多模态AI平台,经20次学术演示对比验证其能提供更优的演示改进支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12768 2026-08-14 cs.CY 新提交 50%

A Generative Framework for the Creation of Multi-Attribute Geographically-Explicit Synthetic Population

用于创建多属性地理显式合成种群的生成框架

Jinlin Wu, Si Qiao, Yi Liu, Fuzhen Yin, Na Jiang

专题命中 规划决策 :agent(abstract)

AI总结 提出一种分层扩散生成框架,可从汇总数据重建多属性区域联合分布,生成含3.32亿个体的地理显式合成种群,效果优于IPF等基线方法,能提升地理模拟的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12741 2026-08-14 cs.IR 新提交 50%

Knowledge Synthesis Review Framework: Task-Level Benchmarking of LLM-Based Systems for Multi-Source Evidence Synthesis

知识综合评审框架:面向多源证据综合的基于大语言模型系统的任务级基准测试

Wafa Shafqat, Mark Patterson, Steven N. Liss

专题命中 规划决策 :workflow(abstract)

AI总结 本研究提出KSR人机协作框架,将证据综合拆分为4项任务,对4款LLM系统开展任务级基准测试,发现各系统各有优劣,该框架可揭示单源综合遗漏的信息,且透明可审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12707 2026-08-14 cs.RO 新提交 50%

SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation

SAP-Nav:空间语义表示与主动感知结合的分层开放词汇对象导航

Xuetong Pei, Jian Liu, Vidura Munasinghe, Bo Miao, U-Xuan Tan, Wenrui Ding, Na Zhao

专题命中 规划决策 :agent(abstract)

AI总结 该研究提出SAP-Nav框架,结合空间语义表示与主动感知,解决分层开放词汇对象导航问题,在基准测试中性能最优且真实场景可行,无需特定训练或预计算场景地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12367 2026-08-14 cs.DB 新提交 50%

Lifecycle-Aware Archival for Asymmetric Financial Datasets: A Production Study

非对称金融数据集的生命周期感知归档:一项生产研究

Tulika Manek

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对金融交易数据库的存储效率与操作新鲜度矛盾,提出生命周期感知归档系统,解决名人分区问题,通过ID单调性去重技术实现热存储缩减、成本降低及性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 50%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 规划决策 :planning(abstract)

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12750 2026-08-14 cs.CV 版本更新 50%

CRC-HGD: A Histopathological Image Dataset for Grading Colorectal Cancer

CRC-HGD:用于结直肠癌分级的组织病理学图像数据集

Elham Amjadi, Amin Bahreini, Sayed Mohammad Hasan Emami, Sayyed Mohammadreza Hakimian, Alireza Fahim, Hojjatollah Rahimi, Hamidreza Bolhasani

专题命中 规划决策 :planning(abstract)

AI总结 介绍用于结直肠癌分级的CRC-HGD数据集,该数据集含1914张来自214名患者的图像,有四个放大级别,涵盖三个分化等级,可通过特定网址获取,能助力结直肠癌分级的全面计算分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25085 2026-08-14 q-bio.PE cs.SI 交叉投稿 50%

Explorations of Epidemiological Dynamics across Multiple Population Hubs

多人口中心的流行病学动力学探索

Daniel Perkins, Davis Hunter, Drake Brown, Trevor Garrity, Wyatt Pochman

专题命中 规划决策 :planning(abstract)

AI总结 本研究扩展经典SIR模型,纳入治愈机制与城市间迁移,通过微分方程组模拟城市网络的疾病传播,给出迁移框架的人口收敛理论结果,开展数值模拟探究治愈时机对死亡率的影响,为流行病学研究与公共卫生规划提供更具表达力的建模工具。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 26 篇

2505.04997 2026-08-14 cs.AI cs.MA 版本更新 93%

Foam-Agent: A Large Language Model-Based Multi-Agent Framework for Automating Computational Fluid Dynamics Workflows

Foam-Agent:迈向自动化智能CFD工作流程

Ling Yue, Nithin Somasekharan, Tingwen Zhang, Yadi Cao, Zhangze Chen, Shimin Di, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(里士满理工学院计算机科学系) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(里士满理工学院机械、航空航天与核工程系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) College of Education, Zhejiang Normal University(浙江师范大学教育学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 多智能体 :agent(title,title_cn);multi-agent(title,abstract);planning(abstract);workflow(abstract)

AI总结 Foam-Agent通过多智能体框架和大型语言模型,实现自动化CFD工作流程,显著提升模拟效率和成功率。

Comments 34 pages, 9 figures, 9 tables

Journal ref Computer Methods in Applied Mechanics and Engineering, Vol. 461, 119271 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏