arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2607.04528 2026-07-07 cs.AI 新提交 57%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 57%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03501 2026-07-07 cs.DB cs.AI cs.MA 新提交 57%

STRATOS: Bridging the Symbolic-to-Numeric Gap in Spatio-Temporal Text-to-SQL for Meteorological Data

STRATOS:弥合气象数据时空文本到SQL中符号到数字的差距

Yi Zhang, Farhad Nooralahzadeh, Jonathan Fürst, Fabio Scherrer, Antonis Bezes, Vassiliki Kotroni, Kurt Stockinger

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对气象数据文本到SQL的问题,提出端到端框架STRATOS,通过解析自然语言解决模糊概念,重写复杂空间谓词,减少执行时间,并引入评估工作负载来测试系统。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02879 2026-07-07 cs.AI 新提交 57%

MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents

MedCalc-Pro:使用大语言模型智能体解决复杂医学计算问题

Siran Zhao, Ruihui Hou, Ziyue Huai, Chennuo Zhang, Tong Ruan

机构 * East China University of Science and Technology(华东理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对医学计算评估大语言模型的基准过于简化的问题,提出新基准MedCalc-Pro及更通用智能体框架,含多场景任务设置和真实病例,新框架性能最佳,为评估应用LLMs提供新基准和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 57%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 57%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21585 2026-07-07 cs.LG cs.IT math.DG math.IT math.ST stat.TH 新提交 57%

A Transport-Based Geometry of Belief-Cost

信念的成本几何:有限资源下含噪观测的推理

Laurent Caraffa

机构 * Université Gustave Eiffel, LASTIG, IGN-ENSG(古斯塔夫·埃菲尔大学,LASTIG,IGN-ENSG)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文引入信念空间的成本几何(Wasserstein最优传输经Fisher信息共形加权),证明确定性被观测和物理双重否定,并揭示三个不变结果:推理墙、诚实成本与刚性双曲几何,其中高斯分布为最极端位置-尺度信念。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 57%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 57%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02496 2026-07-03 cs.RO cs.LG 新提交 57%

Controllable Sim Agents with Behavior Latents

具有行为潜变量的可控模拟智能体

Juanwu Lu, Junyu Zhu, Ziran Wang

机构 * Purdue University(普渡大学) University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。

Comments 23 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01537 2026-07-03 cs.LG 新提交 57%

Certified World Models as Sensing Clocks: Drift-Aware Deadlines for Active Perception

认证世界模型作为感知时钟:主动感知的漂移感知截止时间

Hongbo Wang

机构 * Hongbo Wang(王Hongbo)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种基于认证世界模型的感知时钟,通过漂移感知的截止时间规则决定主动感知时机,在合成基准和3D VN-JEPA模型上验证了有效性。

Comments 15 pages, 3 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31947 2026-07-03 cs.CL 新提交 57%

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

LuxEmo:卢森堡语表达性文本转语音语料库

Nina Hosseini-Kivanani, Sandipana Dowerah

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 针对低资源语言卢森堡语,提出LuxEmo语料库(21小时,4种情感),采用半自动策展流程,并基准测试五种表达性TTS系统。

Comments 7 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00512 2026-07-02 cs.LG stat.ML 新提交 57%

From Structural Equation Modelling to Double Machine Learning: Robustness Analysis for Survey-Based Research

从结构方程模型到双机器学习:基于调查研究的鲁棒性分析

Ka Ching Chan, Qiana Liu, Sanjib Tiwari, Ranga Chimhundu

机构 * School of Business, Law, Humanities and Pathways(商学院、法律、人文与路径学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出一个分阶段鲁棒性分析框架,结合SEM、OLS和双机器学习,通过FinTech数字客户亲密调查模型验证,识别稳定与需谨慎解释的关系,并提供可复现模板。

Comments 21 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00436 2026-07-02 cs.AI 新提交 57%

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准

Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 57%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31055 2026-07-01 cs.CL cs.SD eess.AS 新提交 57%

Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

基于参考的口语对话系统韵律与节奏评估

Ashish Hallur, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30774 2026-07-01 cs.AI 新提交 57%

What Drives Interactive Improvement from Feedback?

什么驱动了来自反馈的交互式改进?

Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki, Szymon Pobłocki, Alicja Ziarko, Piotr Miłoś

机构 * University of Warsaw(华沙大学) AKCES NCBR Princeton University(普林斯顿大学) Mistral AI Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。

Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30701 2026-07-01 cs.CR cs.AI 新提交 57%

An AI-Based Solution for Secure Service Provisioning in IoT

基于人工智能的物联网安全服务提供解决方案

Marco Arazzi, Mert Cihangiroglu, Serena Nicolazzo, Antonino Nocera, Vinod P

机构 * Department of Electrical, Computer and Biomedical Engineering, University of Pavia(帕维亚大学电气、计算机与生物医学工程系) Department of Computer Applications, Cochin University of Science and Technology(科钦科技大学计算机应用系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种结合深度强化学习和联邦学习的框架,用于在物联网环境中选择可靠智能对象并监控其行为,以增强服务提供的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27595 2026-06-29 cs.CL 新提交 57%

Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents

Ko-WideSearch: 面向网络代理的韩语广度搜索基准测试,用于穷举集合枚举

Minbyul Jeong

机构 * Upstage AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出韩语广度搜索基准Ko-WideSearch,通过自动化合成与验证流水线构建,评估网络代理在穷举集合枚举任务中的性能,发现代理在行级召回上显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 57%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 57%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 57%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26158 2026-06-26 cs.AI 新提交 57%

Life After Benchmark Saturation: A Case Study of CORE-Bench

基准测试饱和之后:CORE-Bench 案例研究

Nitya Nadgir, Sayash Kapoor, Kangheng Liu, Peter Kirgis, Matilda Orona, Stephan Rabanser, Tilman Bayer, Abhishek Shetty, Yue Ling, Derrick Chan-Sew, Rumi Nakagawa, Saiteja Utpala, Zachary S. Siegel, Arvind Narayanan

机构 * Independent(独立机构) Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对基准测试准确率饱和问题,提出从构造效度、泛化性、效率、可靠性、模型与脚手架相对重要性及人机协作提升六个维度评估智能体,以CORE-Bench Hard为案例展示饱和后仍可获得有意义见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 57%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25170 2026-06-25 stat.ML cs.LG 新提交 57%

Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

外生上下文马尔可夫决策过程中学习的极小极大PAC界

Corentin Pla, Hugo Richard, Marc Abeille, Vianney Perchet

机构 * CREST, ENSAE(CREST与ENSAE) Criteo AI Lab(Criteo人工智能实验室) FairPlay Joint Team(FairPlay联合团队)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对外生上下文表格折扣MDP,提出方差缩减算法实现策略评估、最优值估计和最优策略提取,样本复杂度与上下文空间大小无关且达到极小极大最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25012 2026-06-25 cs.LG 新提交 57%

Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

偏置控制的原对偶自然演员-评论家:约束多目标平均奖励强化学习的最优速率

Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal

机构 * Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度) Purdue University, USA(普渡大学,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对平均奖励设置下的约束多目标强化学习,提出基于MLMC的原对偶自然演员-评论家算法,控制标量化目标、约束评估和演员-评论家估计中的偏置,实现最优全局收敛和约束违反率。

详情

展开后加载摘要…

URL PDF HTML 收藏