arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 88 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 88 篇

2608.31041 2026-09-01 q-fin.CP 新提交 88%

Agentic Quantitative Trading: A Survey of Workflows, Systems, and Evaluation

智能体量化交易:工作流、系统与评估综述

Fengrui Hua, Hengyi Yang, Xinlei Hao, Haohan Zhang, Bokai Cao, Yiyan Qi, Jia Li, Jian Guo

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 该综述梳理智能体量化交易的工作流阶段、系统特性与评估基准,指出当前系统多集中于信号发现,多智能体系统依赖聚合,且模型能力未必转化为实盘交易性能,并展望了未来研究方向。

Comments 9 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29519 2026-09-01 cs.CV 新提交 88%

FuncRoom-Agent: Sequential Feed-Forward 3D Functional Indoor Scene Generation

FuncRoom-Agent:序贯前馈式3D功能室内场景生成

Hao Feng, Zhi Zuo, MingJian Liang, Jingyu Hu, Xiaowei Hu, Liupengfei Wu, Dian Zhang, Guoxin Fang, Zhengzhe Liu

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract)

AI总结 FuncRoom-Agent提出序贯前馈框架,结合递归DSL与ScenePRM奖励,实现高效高质量3D功能室内场景生成,在两类生成任务上达SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28628 2026-09-01 cs.AI cs.CY physics.ao-ph 新提交 87%

CDEP Agent: Connecting Meteorologically Detected Temporal Compound Events to Real-World Documentary Evidence

CDEP智能体:将气象检测到的时间复合事件与现实世界的文献证据相连接

Zhuoran Li, Weiyi Kong, Boer Zhang

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 本研究提出可审计的LLM智能体框架CDEP Agent,以加利福尼亚为案例发现多数气象检测到的复合干旱至极端降水事件未被现实记录,为多领域提供复合事件证据基础。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新 87%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);planning(abstract);workflow(abstract)

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: https://doi.org/10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-09-01 cs.AI cs.MA 版本更新 85%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30519 2026-09-01 q-fin.GN cs.CR 新提交 85%

Authority-Inference Separation in Agentic Finance: First-Line Control, Blockchain Enforcement, and Replayable Assurance

智能体金融中的权限-推理分离:一线控制、区块链执行与可重放保障

Hui Gong, Michail Samawi, Francesca Medda

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本研究提出智能体金融的权限-推理分离(AIS)架构,经多场景测试,AIS可抵御多数授权攻击、重放等风险,与区块链互补保障金融操作安全。

Comments 24 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29834 2026-09-01 cs.CL cs.IR 新提交 83%

You Know What I Mean: A Benchmark for Agentic Conversational Reference Grounding

你懂我意思:智能体对话指代消歧基准

Karen Fuchs, Uri Katz, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 Agent评测 :agentic(title);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 本研究构建了基于GitHub代码仓库的RepoRef基准,针对对话指代消歧任务,发现现有最优智能体仅达67%成功率,为多工具环境下智能体信息处理研究提供了基准。

Comments 23 pages, 6 figures, Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29228 2026-09-01 cs.AI cs.MA 新提交 83%

Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay

智能体AI中涌现故障的定位:通过反事实回放恢复最小修复族

Bingjie Li, Yumeng Song, Zhongming Yao, Tianyi Li

机构 * Northeastern University(东北大学) Aalborg University(奥尔堡大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究针对智能体AI中LLM智能体交互引发的涌现故障,提出GCJR方法恢复最小修复族,在基准和试点案例中实现1.000族精确匹配,显著减少回放或模型调用次数。

Comments 6 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25891 2026-09-01 cs.AI cs.DB 版本更新 83%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29581 2026-09-01 cs.DC 新提交 82%

Bridging Agent Semantics with Spot Capacity: An Elastic and Recoverable Service Model

连接智能体语义与现货容量:一种弹性且可恢复的服务模型

Minchen Yu

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 该研究提出SemSpot语义感知服务模型,使智能体应用利用LLM推理平台现货容量,经1535个案例验证可优化成本等表现,还开发了实现该模型的相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28877 2026-09-01 physics.optics cs.MA 新提交 82%

HALO: A Physics-Aware LLM Agent Framework for Nanophotonic Design

HALO:用于纳米光子设计的物理感知大语言模型智能体框架

Yubo Zhang, Jinlin Xiang, Zijun Zhao, Yang Zhao, Eli Shlizerman, Arka Majumdar

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 该研究提出HALO框架及52任务基准HALO-Bench,对比三类规划器配置,发现固定结构化工作流效率最高,自主编码成功率更高但故障更多,复用失败轨迹可减少迭代与令牌使用,明确了科学智能体的相关权衡。

Comments 9 pages, 3 figures, 5 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31111 2026-09-01 cs.CL 新提交 81%

Aspire: Can Models Self-Evolve from Vague Goals?

ASPIRE:模型能否从模糊目标中实现自我进化?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动 Seed) Singapore University of Technology and Design(新加坡科技设计大学) M-A-P

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.CL

AI总结 本文提出ASPIRE基准,探究模型能否从模糊目标实现自我进化,实验发现当前智能体虽能完成基础循环,但权重提升不稳定,最强进化harness仍低于Qwen-Agent基准。

Comments this https URL (https://self-developing-agents.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02975 2026-09-01 cs.AI cs.CL 版本更新 81%

Where Knowledge and Authority Sit Changes What an Agent Benchmark Can Resolve

使用Incognita评估基于社会分布式任务环境中行动的生成智能体

Dan C. Hsu, Luke Lu

机构 * RedMind Research(RedMind研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27984 2026-09-01 cs.CL cs.AI 版本更新 81%

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KVoiceBench, KOpenAudioBench 和 KMMAU:用于评估语音语言模型的智能体驱动的韩语语音基准

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee

机构 * KRAFTON Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对语音语言模型评估中英语中心化的问题,提出两种智能体驱动的基准构建框架,构建并发布了三个韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),通过评估八个最新模型揭示了英语-韩语性能差距和不同任务间的互补性弱点。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30369 2026-09-01 cs.AI cs.HC 新提交 79%

Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence

利用从在线行为和BCI证据学习的XR智能体增强人类表现

Ziheng Li, Xichen He, Haoyan Chen, Charlie Zou, Sheng Bai, Benjamin Yang, Mengyuan Wu, Jake Ledner, Yi-Jie Cheng, Akito Yamauchi, Dishita G Turakhia, Steven Feiner, Paul Sajda

机构 * Columbia University(哥伦比亚大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究人员提出OLIVE框架,通过融合EEG与XR游戏行为信号,适配基础模型生成实时辅助智能体,在目标切换时收敛更快,可提升用户目标检测能力且不依赖个人技能。

Comments To appear in ACM UIST 2026. 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29206 2026-09-01 cs.AI 新提交 79%

Benevolent Bias in Multi-Turn Human-Agent Dialogue

多轮人机对话中的善意偏见

Qianqi Liu, Jin Huang, Fethiye Irmak Dogan, Hatice Gunes

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对人机对话中隐藏在积极语气后的善意偏见,构建了标注语料库并测试两类检测器,发现现有安全检测器难识别善意偏见,LLM评判器易误判,需关注对待方式差异以实现公平监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28612 2026-09-01 cs.AI 新提交 79%

InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal

InternReviewer与InternAdvocate:面向同行评审与反驳的智能体强化学习的客观奖励与评估

Xuerui Su, Liya Guo, Qizhi Pei, Qipeng Guo, Zhongbo Tian, Lijun Wu, Kai Chen, Zun Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Beijing Jiaotong University(北京交通大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本研究提出InternReviewer与InternAdvocate框架,构建学术数据集与arXiv检索工具,采用多维度标准的客观奖励系统优化智能体RL,训练后智能体推理深度与引用准确性显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22808 2026-09-01 cs.LG cs.MA cs.PF 版本更新 79%

CatchBench: When Can an Agent Failure Be Caught?

CatchBench:智能体故障何时能被检测?

Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。

Comments 40 pages, 6 figures, 22 tables. Work in progress. Code and data: this https URL (https://github.com/yzhao062/catchbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-09-01 cs.AI 版本更新 79%

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23927 2026-09-01 cs.AI 版本更新 79%

RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

RIFT-Bench:面向智能体AI系统的动态红队测试

Yarin Yerushalmi Levi, Roy Betser, Amit Giloni, Lidor Erez, Itay Gershon, Oren Rachmil, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究院) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人研究有限公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出RIFT-Bench,一种基于图表示的动态红队测试方法,用于统一评估异构智能体AI系统的安全性,通过自动发现系统结构并部署自适应对抗攻击。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-09-01 cs.AI cs.CV 版本更新 79%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-01 cs.CL cs.AI 新提交 79%

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyuk Park, Dongwook Cheon, Myungjae Jeon, Sunjong Choi, Soonho Kong, Wonseok Heo, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30257 2026-09-01 cs.GT 新提交 78%

Residual Maximin Share: Exact Finite-Agent Frontier, Sparse Extremizers, and Threshold Cuts

剩余最大最小份额:精确有限智能体边界、稀疏极值器与阈值割

Qinghua Qin

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文证明剩余最大最小份额(RMMS)与经典最大最小份额(MMS)的有限智能体下界精确,构造线性支撑的三值极值实例,建立RMMS的结构特征,为基于份额的单独分割算法的公平保证设定严格限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29992 2026-09-01 cs.CV 新提交 78%

SVI2LoD3: Agent-Driven Reconstruction of LoD3 Facade Openings in Semantic 3D City Models from Volunteered Street View Imagery using Large Language and Visual Models

SVI2LoD3:基于智能体的、利用大语言与视觉模型从众包街景图像中重建语义三维城市模型的LoD3立面开口方法

Elmehdi Kanna, Lukas Arzoumanidis, Huynh Duc An Son Nguyen, Youness Dehbi

机构 * HafenCity University(汉堡港口城市大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 SVI2LoD3提出一种由智能体驱动的零样本分割重建管道,结合新型FFD指标,可从街景图像生成符合标准的LoD3三维城市模型,减少标注量且评估更贴合实际需求

Comments Accepted for publication in the ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-09-01 cs.AI 版本更新 77%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28641 2026-09-01 cs.CL cs.AI 新提交 76%

Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture

Terminal-Bench-LILT:基于语言、区域与文化的多语言智能体编码基准

Yunsu Kim, Kaden Uhlig, Ashwin Purohit, Milind Agarwal, Patrick Simianer, Anil Arslan, Kiarash Mokhtari, Thomas Zenkel, Johannes Mosig, Gabriel Bretschner, Shamik Bose, Joern Wuebker, John DeNero

机构 * LILT, Inc.(LILT公司)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL

AI总结 本文提出Terminal-Bench-LILT多语言编码基准,含10种语言300个任务,评估6个前沿模型发现其通过率仅63.1%,凸显多语言编码能力是未被充分探索的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28697 2026-09-01 cs.RO 新提交 75%

Multi-Group Pipe Routing under Permanent Geometric Occupancy: Problem, Benchmark, and Classical Baselines

永久几何占用下的多组管道路由:问题、基准及经典基线

Deng Quan

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 针对增材制造中多组流道永久占用体积的路由问题,提出带几何双见证冲突的形式化方法、可控难度的3D基准及CBS等经典基线,验证了CBS性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29971 2026-09-01 cs.AI cs.LG 新提交 73%

EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration

EDGE:基于图结构DSL配置的对话模拟实现确定性图评估的引擎

Ram Kulathumani, Regunathan Radhakrishnan, Anupam Tripathi, Xiangbo Mao, Roshanak Omrani, Keshav Somani, Shwet Kamal Mishra, Shayna Lurya

机构 * Salesforce

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 EDGE基于AgentGraph等框架,通过图遍历生成对话路径评估集,定义新指标量化智能体确定性,证实带受控节点转换的智能体确定性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-09-01 cs.CL cs.AI 版本更新 73%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 35 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2026-09-01 cs.CL cs.AI cs.CV 版本更新 73%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

MM-BrowseComp:多模态浏览智能体的综合基准

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :AI agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。

Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at this https URL (https://github.com/MMBrowseComp/MM-BrowseComp)

详情

展开后加载摘要…

URL PDF HTML 收藏