arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2608.28345 2026-08-31 cs.AI 新提交 93%

AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents

AGENT-O:用于可互操作且受管控的医疗AI智能体的语义智能体卡框架

Pengze Li, Cui Tao

专题命中 Agent评测 :agent(title,title_cn);AI agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究人员提出AGENT-O模块化本体框架,定义医疗AI智能体的语义智能体卡,评估279篇论文报告完整性,揭示评估规范差距,为结构化报告提供工具但不评估智能体质量与部署就绪性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27856 2026-08-31 cs.LG cs.AI cs.MA 新提交 86%

FedEHR-Agents: Federated Agentic Optimization for Automated EHR Modeling

FedEHR-Agents:面向自动化电子健康记录(EHR)建模的联邦智能体优化框架

Jun Bai, Ruilin Wang, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 针对医院EHR数据隐私与协作局限,提出以经验为中心的FedEHR-Agents框架,通过联邦智能体聚合建模经验,在多医院EHR基准上的临床预测任务中表现优于基线方法。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28378 2026-08-31 cs.CL 新提交 85%

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems

PersonaForge:面向智能体系统的逼真多轮用户模拟

Hanglong Lv, Dawei Zhu, Lei Li, Bowen Ye, Huaqiu Liu, Yifan Song, Bofei Gao, Weimin Xiong, Jinhao Dong, Chenhong He, Lingpeng Kong, Qi Liu, Tong Yang, Fuli Luo

机构 * Peking University(北京大学) Xiaomi(小米) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.CL

AI总结 该研究针对现有智能体系统训练评估中多轮用户交互数据不足的问题,提出PersonaForge模拟框架构建相关数据集与基准,实验证实其可提升智能体交互效率与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27886 2026-08-31 cs.AI 新提交 83%

Resource Constraints and Performance in Agentic AI Systems

智能体AI系统中的资源约束与性能

Amaz Salman, Malka Halgamuge, Teo Susnjak

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) RMIT University(皇家墨尔本理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究对比OpenClaw与NanoBot两款智能体系统,发现两者完整任务完成率无统计差异,NanoBot部分完成率更高但资源消耗更优,建议智能体AI评估需结合能力、资源及执行记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28542 2026-08-31 cs.CR cs.MA 新提交 82%

Offline-Verifiable Accountability for Cross-Organization Agent Messaging: A Preserved Evidence-Bundle Approach

跨组织智能体消息传递的离线可验证问责性:一种保留证据束的方法

Adil Alshammari, Hayretdin Bahsi

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 针对跨组织智能体消息传递的离线可验证问责需求,提出保留证据束模型及策略控制的离线验证器,原型测试显示其可有效拒绝证据不足的束,无需依赖实时服务。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27475 2026-08-31 cs.AI cs.LG 新提交 81%

Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields

假设、评估、优化:用于空间系数场未知的PDE发现的科学智能体

YuJie Huang, WenWu He, ZhuoEr Lin, Congcong Liu, Dong Liang, Zhuo-Xu Cui

机构 * Fujian University of Technology(福建工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 HER-PDE科学智能体框架分析含噪轨迹提出PDE结构假设,经HEI评估优化后,在5%噪声的二维系统中成功恢复PDE算子,9个未知系数场的中位数皮尔逊相关达0.85,可无参数形式约束发现非均匀PDE。

Comments 33 pages, 4 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28384 2026-08-31 cs.AI 新提交 79%

MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places

MAP:面向现实场所的多模态可访问性规划基准

Jason Armitage, Ioannis Tsochantaridis, Linda Mazzone, Chuqiao Yan, Srini Narayanan, Sarah Ebling

机构 * University of Zurich(苏黎世大学) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :planning(title,abstract);分类 cs.AI

AI总结 研究推出首个多模态可访问性规划基准MAP,含声明验证与视觉证据检索两项评估,支持动态信息下的AI系统对比,为服务可访问性需求用户的多模态AI提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28027 2026-08-31 cs.AI 新提交 79%

String: An Agentic OS Where Every App Is a Markdown File

一种智能体操作系统:每个应用都是一个 Markdown 文件

Jookyung Song, Nojun Kwak, Simyung Chang

机构 * Seoul National University(首尔大学) H1R.AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出开源智能体操作系统 String,将应用定义为 SFMD 文档,通过分阶段视图和权限机制提升 LLM 智能体操作效率,在 87 任务基准测试中减少 token 消耗并保持良好成功率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27843 2026-08-31 cs.CL cs.MA 新提交 79%

Synthetic Linguistic Agency: How an Embodied Mortal Agent Learns Linguistic Affordances through Consequential Social Experience

合成语言智能体:具身化有限生命智能体如何通过具有因果关系的社会经验学习语言可供性

Sixin Chen, Taizhou Chen

机构 * College of Engineering, Shantou University(汕头大学工程学院) Department of Computer Science, Shantou University(汕头大学计算机科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本研究提出合成语言智能体(SLA)的可检验标准,开发具身化有限生命智能体(EMA)模型,证实其能通过社会经验学习语言可供性并展现SLA,为合成共情与人机交互研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27800 2026-08-31 cs.CR cs.AI 新提交 79%

ContextLeak: Exfiltrating LLM Agent Context via Malicious Tools

ContextLeak:通过恶意工具窃取大语言模型智能体的上下文

Yuqi Jia, Ruiqi Wang, Patrick Li, Yuepeng Hu, Peinian Li, Neil Gong

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出ContextLeak恶意工具攻击,通过强化学习设计工具名称与描述诱导LLM智能体泄露上下文,其在影子用户与受害者上下文差异大时仍保持高有效性,且性能优于现有同类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27487 2026-08-31 cs.SE 新提交 79%

Grounded Checklist Partial Credit for Agent Skill Trajectories

智能体技能轨迹的基于接地检查表的部分 credit 评估

Suliu Qin, Lu Yin, Xilu Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 针对智能体轨迹评估的二元评分缺陷,提出 GCPC 方法,结合人工规则与 LLM 生成检查表,在 SkillsBench 等数据集上验证其评估区分度、与人类评估一致性及跨数据集迁移性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14940 2026-08-31 cs.AI cs.CY 版本更新 79%

When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation

智能体评估何时结束?结果终局性与跨单元分离

Avyay M. Casheekar, Hariganesh Tangirala

机构 * University of Michigan Law School(密歇根大学法学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对现有智能体评估将终点分数视为最终结果的问题,该研究提出结果终局性与跨单元分离两个条件,通过实验和协议审查指出当前评估的不足,并提出开放效应记录方案以完善评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03889 2026-08-31 cs.CL 版本更新 79%

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench: 来自真实开发者-智能体会话的实时OpenClaw基准测试

Zongwei Lv, Yaoming Li, Zhewen Tan, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 针对现有基准缺乏真实性的问题,提出RealClawBench框架,通过重构执行环境和确定性可验证评分器,将真实OpenClaw会话转化为可复现、自动评分的任务,评估14个模型后最佳仅解决65.8%任务,揭示了开发者-智能体工作负载上的巨大提升空间。

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28122 2026-08-31 cs.MM 新提交 78%

Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities

智能体工件创建:系统、评估、原则与机遇

Tianfu Wang, Zhezheng Hao, Xilin Xia, Lixin Liu, Mengkang Hu, Hongzhang Liu, Xi Chen, Ziyan Liu, Xiankun Lin, Weijia Zhang, Nicholas Jing Yuan, Hui Xiong

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本综述研究智能体工件创建,分析259项相关研究,明确其定义与功能结构,制定相关原则并识别维持控制的机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28502 2026-08-31 cs.CR 新提交 71%

Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control

无执行的识别:大语言模型智能体指令仲裁与外部控制中依赖配置的失效

Jun Wen Leong

专题命中 Agent评测 :agent(title)

AI总结 本研究发现大语言模型智能体存在指令仲裁的识别-执行缺口,提出外部参考监控器实现安全控制,证明安全智能体需外部执行而非仅依赖识别。

Comments 81 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27931 2026-08-31 cs.LG 新提交 70%

TI$^2$PS: A Topology-Informed Inverse Design Framework for Stochastic Multicellular Pattern Formation

TI²PS:面向随机多细胞模式形成的拓扑感知逆向设计框架

Kenji Komiya, Andrew Kailiang Jin, Ryo Nishikimi, Kunio Kashino

机构 * NTT, Inc.(NTT公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出TI²PS框架,整合贝蒂向量与逆向代理建模,以斑马鱼色素模式为验证对象,仅用10%训练数据即优于全数据训练的PointNet++,实现多细胞ABBM参数的高效准确估计。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27716 2026-08-31 cs.AI 新提交 70%

PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation

PCFBench:产品碳足迹估算的诊断基准

Krishna Rao, Andrew Dumit, Shaena Ulissi, Jacob Feintzeig, P. James Joyce, Daniel Frank, Steven Watson, Jonathan Glidden, Gizem Ilayda Dinc, Travis M. Kwee

机构 * Watershed Technology, Inc.(沃特斯hed科技公司)

专题命中 Agent评测 :AI agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究推出PCFBench基准,针对现有PCF评估的缺陷,通过含614个条目的6项任务评估前沿LLM,发现其逐步生成PCF的准确率及质量守恒符合率均较低,将发布相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-08-31 cs.AI cs.HC 版本更新 70%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28198 2026-08-31 cs.LG cs.AI stat.ML 新提交 62%

Performative Privacy: When Differential Privacy Maximizes Utility

表演式隐私:当差分隐私最大化效用时

Uddalak Mukherjee, Edwige Cyffers, Yann Chevaleyre

机构 * Dauphine PSL(巴黎第九大学PSL校区) CNRS(法国国家科学研究中心)

专题命中 Agent评测 :agent(abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究结合表演式学习与隐私保护,提出表演式隐私概念,通过理论与实验证明,当数据泄露与用户参与的反馈回路足够强时,有限隐私预算的差分隐私机制在长期效用上优于非隐私估计。

Comments Accepted at EuroTDP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28281 2026-08-31 cs.AI 新提交 57%

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

LoopArena:将模型作为循环工程运行时控制器的基准测试

Yi Wang, Haopeng Zhang, Chengxiang Huang, Rui Dai, Kaikui Liu, Piotr Koniusz, Xiangxiang Chu

机构 * DreamX Team, Alibaba Group(达摩院团队,阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学) UNSW Sydney(新南威尔士大学悉尼分校) Data61, CSIRO(联邦科学与工业研究组织数据61研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究推出LoopArena基准,评估模型作为控制器指导编码智能体完成长期任务的能力,发现完整任务上最佳严格成功率为24.69%,推理成本平均降低64.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28011 2026-08-31 cs.AI 新提交 57%

Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents

覆盖度而非信用:零阶扰动预算的失败-信用路由并不能提升LLM智能体的池内样本效率

Yuxu Ge

机构 * University of York(约克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究探究将ZO/ES扰动预算按LLM智能体失败信用路由是否提升池内样本效率,发现多数场景下无显著增益,仅在未见过的BFCL函数的保留端点上有一处例外,还记录了三种相关实验失败模式。

Comments 19 pages, 3 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 57%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27911 2026-08-31 cs.LG 新提交 57%

TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision

TACIT-Switch:基于审查式监督的大语言模型智能体成本感知模型升级方案

Ji'an Lei, Jian Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 TACIT-SWITCH从审查式监督学习切换策略,在可比成本下提升大语言模型智能体成功率7.4-11.1个百分点,在ALFWorld和DABench上取得最优保留成功率。

Comments 17 pages, 6 figures, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27840 2026-08-31 cs.AI cs.IR 新提交 57%

An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark

大规模基准下跨城市兴趣点(POI)推荐的实证评估

Peibo Li, Yang Song, Hao Xue, Maarten de Rijke, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Amsterdam(阿姆斯特丹大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文以大规模基准Trip World开展跨城市POI推荐实证评估,发现现有SOTA方法存在三个瓶颈,且适配的智能体方法效果不佳,凸显需设计任务特定的跨城市推荐方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27734 2026-08-31 q-fin.ST 新提交 50%

What survives honest evaluation? Leakage-safe, search-aware assessment of LLM-driven trading strategy discovery

经得住诚实评估的是什么?针对大语言模型驱动的交易策略发现的防泄漏、感知搜索的评估方法

Eray Gençay

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对LLM发现交易策略时的前瞻偏差与搜索强度未校正问题,提出防泄漏的结构防护及基于试验次数的性能调整系统,经实证验证其可诚实评估策略并量化可信验证所需样本量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21231 2026-08-31 cs.GT econ.TH 版本更新 50%

Scale-robust Auctions

尺度鲁棒拍卖

Jason Hartline, Aleck Johnsen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出尺度鲁棒拍卖,证明分布族正缩放封闭时尺度不变机制不损失最优性,求解双代理人单物品问题的鲁棒最优机制,其最坏情况近似比约1.907,为拍卖设计提供理论支撑。

Comments Part of the results from this work has appeared in FOCS'20 under the title "Benchmark Design and Prior-independent Optimization"

详情

展开后加载摘要…

URL PDF HTML 收藏