arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-11 至 2026-08-11 共收录 427 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 78 篇

2608.09168 2026-08-11 cs.AI 新提交 57%

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控

Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

机构 * Tongji University(同济大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) Nankai University(南开大学) Johns Hopkins University(约翰斯·霍普金斯大学) City University of Hong Kong(香港城市大学) University of Surrey(萨里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09024 2026-08-11 cs.CL 新提交 57%

ELICITED: EHR-grounded Longitudinal Interactive Conversations for Information-seeking Triage Evaluation and Decision-making

ELICITED:基于电子健康记录(EHR)的纵向交互式对话,用于信息获取类分诊评估与决策

Haohao Zhu, Xiaolin Shi, Jiayu Zhou

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 该研究针对现有ED分诊基准未捕捉交互式证据引出过程的问题,提出基于MIMIC-IV-ED的EHR2Dial-Triage智能对话框架与基准,支持对信息引出等任务的受控评估,为对话式分诊研究提供结构化环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08942 2026-08-11 cs.CL 新提交 57%

Same Question, Different Answer? Measuring and Mitigating Prompt Privilege for Equitable AI Access

相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问

Lier Jin, Lan Hu, Binqi Shen, Hanyu Cai, Yuting Xin

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08528 2026-08-11 cs.LG 新提交 57%

Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing

面向企业大语言模型代码助手的任务到模型优化:一种成本最优路由的数据驱动框架

Srinivasan Manoharan, Junhua Zhao, Fangbo Tu, Haifeng Wu, Jian Wan, Maliah Rajan M, Ashwin Hegde, Mithun Sasidharan, Kalyan Chakravarthi Podamekala

机构 * PayPal(贝宝(PayPal))

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究针对企业LLM代码助手的推理成本问题,提出T2MO数据驱动框架,通过任务分级与两级路由机制实现成本最优,可降低端到端成本并支持从静态策略到智能路由器的过渡。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07873 2026-08-11 cs.AI 新提交 57%

Back to the Future: A workbook time machine for spread sheet creation benchmarks

回到未来:用于电子表格创建基准测试的工作簿时光机

Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07770 2026-08-11 cs.LG cs.CV 新提交 57%

From Benchmark Performance to Tool Deployment: Human-in-the-Loop Anomaly Detection

从基准性能到工具部署:人机协同的异常检测

Mike Szklarzewski, CJ George, Gavin Smithson, Christopher Stokes, Dakota Fulp, William M. Jones, Benjamin Wynn, Alexander Ur, Agit Yesiloz, Clint Kallenbach, Mark Swartz, Nathan DeBardeleben, Sharmistha Chakrabarti

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Triad National Security, LLC(Triad国家安全有限责任公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本研究通过评估19种无监督异常检测模型在BowTie制造数据集上的表现,揭示了基准性能与工业部署的差距,开发并部署了人机协同的制造部件检测框架。

Comments 8 pages, 8 figures, 6 tables. Accepted as a regular paper at the 25th International Conference on Machine Learning and Applications (ICMLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07481 2026-08-11 cs.HC cs.AI 新提交 57%

Cross-Model Humor Preference Modeling with Cards Against Humanity

基于《反人类牌》的跨模型幽默偏好建模

Victor Winter, Farhan Lakhany

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究以《反人类牌》风格任务开展实验,发现大语言模型可通过裁判的先前选择及理由,提升近似另一模型幽默偏好的准确率,为跨模型偏好建模提供操作层面的证据。

Comments 11 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09898 2026-08-11 cs.LG cs.MA q-bio.QM 版本更新 57%

TRAPS: Treatment-Assignment Prediction via Pathway-informed Stratification

TRAPS: 基于通路信息分层的治疗反应分析

Sujoy Banik, Sayantan Chakraborty, Boishakhi Das Toma, Zainab Ghafoor, Ushashi Bhattacharjee, Koushik Howlader, Tirtho Roy

机构 * Rajshahi University of Engineering \& Technology Bangladesh University of Dhaka Bangladesh American International University of Bangladesh Bangladesh Sonoma State University United States Iowa State University United States Rajshahi University of Engineering \& Technology University of Dhaka American International University of Bangladesh Sonoma State University Iowa State University

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 提出首个统一基准,评估三种通路引导的深度学习模型在联合预测癌症治疗反应和生存率上的表现,发现不同模型在不同任务上各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 57%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15645 2026-08-11 cs.LG physics.comp-ph quant-ph 版本更新 57%

Hybrid Quantum-Classical PINNs for Scientific Computing: A Multi-GPU Open-Source Framework

PINNACLE:一种用于经典和量子PINN的开源计算框架

Ziv Chen, Hemanth Chandravamsi, Shimon Pisnoy, Aaron Goldgewert, Gal Shaviner, Boris Shragner, Steven H. Frankel

机构 * Faculty of Mechanical Engineering, Technion Israel Institute of Technology, Haifa, Israel(技术学院机械工程系,以色列技术学院,海法,以色列) Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion Israel Institute of Technology, Haifa, Israel(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术学院,海法,以色列) Helen Diller Quantum Center, Technion Israel Institute of Technology, Haifa, Israel(海伦·迪尔量子中心,技术学院,海法,以色列) Faculty of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA(电气与计算机工程学院,康奈尔大学,纽约州伊萨克,美国)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 PINNACLE框架整合了现代训练策略和混合量子经典架构,通过统一模块化工作流系统评估PINN在不同基准问题中的性能,支持多种增强方法并提供全面的基准研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 57%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 57%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24084 2026-08-11 cs.AI 版本更新 57%

Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search

弥合评估差距:多目标搜索的标准化基准

Hadar Peer, Carlos Hernandez, Sven Koenig, Ariel Felner, Oren Salzman

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22130 2026-08-11 cs.LG 版本更新 57%

Benchmarking In-context Experiential Learning Through Repeated Product Recommendations

通过重复产品推荐评估上下文经验学习

Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出BELA基准,通过重复产品推荐场景评估智能体在动态环境中的经验学习与主动探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09409 2026-08-11 econ.TH 新提交 50%

Information for nothing and authority for free

无成本信息与免费权威

Deniz Kattwinkel, Alexander Winter

专题命中 Agent评测 :agent(abstract)

AI总结 针对无货币转移、代理人未完全内化成本的委托代理项目决策问题,研究提出委托人最优机制无需代理人报告,可选择忽略代理人或赋予其免费信息与完全决策权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 50%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 Agent评测 :workflow(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交 50%

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09724 2026-08-11 eess.SY cs.SI cs.SY 新提交 50%

Analysis and Consensus Control of Emergent Dynamic Polarization in Minimally-Nonlinear Opinion Dynamics

最小非线性观点动力学中涌现动态极化的分析与共识控制

Rajul Kumar, Ningshi Yao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出M-NOD框架解析社交网络观点演化产生的动态极化,证明其稳定性条件,开发局部控制策略仅锚定单个智能体即可消除振荡分歧、恢复共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09061 2026-08-11 cs.GT 新提交 50%

Breaking the 4-Approximation Barrier in Strategyproof Two-Facility Location

策略proof双设施选址问题中突破4近似比障碍

Mengfan Ma, Bo Peng

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在Ptolemaic度量空间中提出随机策略proof双设施选址机制,将最优近似比从4降至约3.667,同时将最优下界从1.045提升至约1.207,突破了此前的4近似比障碍。

Comments 23 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08299 2026-08-11 math.PR math.OC q-fin.MF 新提交 50%

Non-linear optimal stopping with Bermudan strategies: the infinite horizon case

基于百慕大策略的非线性最优停止:无限时域情形

Miryana Grigorova, Ohood Aldalbahi

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对无限时域下带非线性评估的最优停止问题,基于百慕大策略证明动态规划原理、ε-最优停时与最优停时的存在性,给出Doob型收敛结果并提供BSDEs相关示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09545 2026-08-11 physics.optics 新提交 50%

Direct Laser Interference Patterning of Functional Metal Surfaces: From Written Geometry to Functional Interfaces

功能金属表面的直接激光干涉图案化:从写入几何到功能界面

Petr Hauschwitz

专题命中 Agent评测 :agent(abstract)

AI总结 本综述以DLIP为模型系统,指出仅靠几何无法预测金属表面功能,需分离写入几何与形成的界面,明确跨领域变量可转移性,为DLIP表面工程提供预测框架。

Comments Review article, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24676 2026-08-11 cs.GT 版本更新 50%

The Degree of Strategy-Proofness for Risk-Averse Committee Selection

风险规避委员会选择的防策略性程度

Dael Sinay, Rica Gonen

专题命中 Agent评测 :agent(abstract)

AI总结 研究风险规避委员会选择的防策略性程度,将RAT程度框架扩展到基于批准的委员会选择,聚焦比例批准投票规则,通过建立界限表明其在不同选民选票知晓数量下对安全操纵的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23539 2026-08-11 cs.CY 版本更新 50%

Private Again: Artificial Intelligence Agents Restore Anonymity---Foreclosing Discrimination and Its Proof

再次私密:人工智能代理恢复匿名性——消除歧视及其证据

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 Agent评测 :agent(abstract)

AI总结 研究人工智能代理恢复匿名性以消除歧视及证据问题,核心方法是代理介导交易使歧视缺乏输入信息与证据,主要贡献是促使法律将代理介导匿名性作为民权基础设施管理,应对相关挑战。

Comments Forthcoming, Stetson Law Review Forum (Summer 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07018 2026-08-11 cs.HC 版本更新 50%

Designing Youth Social Media through Problem Space Attunement

青少年社交媒体设计中的问题空间调适

JaeWon Kim

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过三种问题空间失调(概念性、定义性、评价性)分析青少年社交媒体设计中的权力失衡,并提出虚构探究工作坊、Discord异步社区和LLM代理模拟沙盒等干预方法,以建立以青少年为中心的关系支持型社交媒体设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14162 2026-08-11 physics.geo-ph physics.ao-ph physics.data-an 版本更新 50%

An Attention-Based Stochastic Simulator for Multisite Extremes to Evaluate Nonstationary, Cascading Flood Risk

基于注意力机制的多站点极端事件随机模拟器用于评估非平稳级联洪水风险

Adam Nayak, Pierre Gentine, Upmanu Lall

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出一种结合注意力机制的多站点洪水模拟框架,通过随机生成多变量洪水频率、强度和持续时间序列,评估非平稳级联洪水风险,为保险和财务规划提供可行的洪水风险模拟。

Journal ref Nayak, A., Gentine, P., and Lall, U. (2026). "Attention-Based Stochastic Simulation of Climate-Informed Spatiotemporal Flood Risk for Multisite Insurance Portfolios." Geophysical Research Letters, 53 (15)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20087 2026-08-11 econ.TH 版本更新 50%

Screening Frontiers

筛选前沿

Frank Yang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了盈余弹性前沿在最优菜单中的作用,证明其在不同机制下的最优性,并应用于多个经济领域。

Comments 75 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08552 2026-08-11 nlin.AO math.DS 版本更新 50%

Extreme vulnerability to intruder attacks destabilizes network dynamics

极端的入侵攻击对网络动态的脆弱性

Amirhossein Nazerian, Sahand Tangerami, Malbor Asllani, David Phillips, Hernan Makse, Francesco Sorrentino

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了网络中单个低度节点的入侵攻击如何破坏动态稳定性,挑战了传统对枢纽节点脆弱性的假设,并揭示了非线性网络中的脆弱性特征。

Comments Accepted for publication in Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06586 2026-08-11 cs.CY 版本更新 50%

Simulating Dispute Mediation with LLM-Based Agents for Legal Research

基于大语言模型智能体的争议调解模拟:面向法律研究

Junjie Chen, Haitao Li, Minghao Qin, Yujia Zhou, Yanxue Ren, Wuyue Wang, Yiqun Liu, Yueyue Wu, Qingyao Ai

专题命中 Agent评测 :agent(abstract)

AI总结 研究针对法律争议调解实证研究的局限,提出首个基于LLM的AgentMediation框架模拟争议调解,通过可控实验发现符合社会学理论的模式,为社科与AI在法律研究的融合提供平台。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03638 2026-08-11 cs.DS 版本更新 50%

Stability Notions for Hospital Residents with Sizes

带容量的医院住院医生问题的稳定性概念

Haricharan Balasundaram, J B Krishnashree, Girija Limaye, Meghana Nasre

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对带容量的医院住院医生问题(HRS)研究基于容量的稳定性,证明该类问题必存在对应稳定匹配,给出严格优于3的近似算法,还证明最大规模该匹配问题及稳定匹配判定问题的NP难性,并提出受限场景下的稳定匹配高效算法。

详情

展开后加载摘要…

URL PDF HTML 收藏