arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

1712.01648 2017-12-06 cs.MA 60%

The Role of Compliance in Heterogeneous Interacting Agents: Data from Observations

Stefania Bandini, Luca Crociani, Giuseppe Vizzari, Flavio Soares Correa da Silva, Andrea Gorrini

专题命中 Agent评测 :agent(abstract,comments);autonomous agent(comments)

Comments Pre-print of a paper presented at the 2nd International Workshop on Agent-based modelling of urban systems - ABMUS 2017, at the 16th International Conference on Autonomous Agents and Multiagent Systems - AAMAS 2017, 8-12 May 2017, Sao Paulo, Brazil (in press, 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
1310.7951 2013-10-31 cs.MA 60%

IRM4MLS: the influence reaction model for multi-level simulation

Gildas Morvan, Alexandre Veremme, Daniel Dupont

专题命中 Agent评测 :agent(abstract,journal_ref);multi-agent(journal_ref)

Journal ref Multi-Agent-Based Simulation XI, LNCS 6532, 2011, pp 16-27

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00550 2024-03-04 cs.LG cs.AI 59%

Imitation Learning Datasets: A Toolkit For Creating Datasets, Training Agents and Benchmarking

Nathan Gavenski, Michael Luck, Odinaldo Rodrigues

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(comments);autonomous agent(comments);multi-agent(comments)

Comments his paper has been accepted in the demonstration track for the 23rd International Conference on Autonomous Agents and Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15398 2022-10-03 cs.CV cs.AI cs.LG stat.ML 59%

Evaluation of importance estimators in deep learning classifiers for Computed Tomography

Lennart Brocki, Wistan Marchadour, Jonas Maison, Bogdan Badic, Panagiotis Papadimitroulas, Mathieu Hatt, Franck Vermet, Neo Christopher Chung

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(comments);autonomous agent(comments);multi-agent(comments)

Comments 4th International Workshop on EXplainable and TRAnsparent AI and Multi-Agent Systems (EXTRAAMAS 2022) - International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS)

Journal ref 2022 EXTRAAMAS 2022, Lecture Notes in Computer Science (LNAI, volume 13283)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08996 2022-07-15 cs.LG cs.AI cs.GT cs.MA stat.ML 59%

Voting with Random Classifiers (VORACE): Theoretical and Experimental Analysis

Cristina Cornelio, Michele Donini, Andrea Loreggia, Maria Silvia Pini, Francesca Rossi

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(journal_ref);autonomous agent(journal_ref);multi-agent(journal_ref)

Journal ref Autonomous Agents and Multi-Agent Systems volume 35, Article number: 22 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01160 2022-04-05 cs.AI cs.LG cs.MA 59%

Best-Response Bayesian Reinforcement Learning with Bayes-adaptive POMDPs for Centaurs

Mustafa Mert Çelikok, Frans A. Oliehoek, Samuel Kaski

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(comments);autonomous agent(comments);multi-agent(comments)

Comments This paper is presented in part at the International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08966 2022-02-10 cs.LG cs.AI 59%

Decoupled Reinforcement Learning to Stabilise Intrinsically-Motivated Exploration

Lukas Schäfer, Filippos Christianos, Josiah P. Hanna, Stefano V. Albrecht

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(comments);autonomous agent(comments);multi-agent(comments)

Comments Published at the International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.08771 2016-04-01 cs.LG cs.AI stat.ML 59%

Investigating practical linear temporal difference learning

Adam White, Martha White

专题命中 Agent评测 :分类 cs.AI、cs.LG;agent(comments);autonomous agent(comments);multi-agent(comments)

Comments Autonomous Agents and Multi-agent Systems, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23572 2026-08-26 q-bio.NC cs.AI cs.CV 新提交 57%

A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Vision

面向具身主动视觉的、由人因因素引导的视觉空间认知复杂度模型

Vasiliki Kondyli, Jakob Suchan, Mehul Bhatt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出一种多模态复杂度分析框架,以具身认知和主动视觉理论为基础,结合人因因素,为日常驾驶场景下视觉空间复杂度的表征及相关数据集构建提供理论支撑。

Comments Preprint; AIC 2025: Artificial Intelligence and Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 57%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23839 2026-08-26 cs.RO cs.AI 新提交 57%

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

弹性对具身智能体系统的重要性:新指标、系统评估与优化

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang

机构 * National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对具身智能体系统忽略弹性属性的问题,提出弹性评估框架与指标集,经400项家庭任务实验验证其诊断优化效果,揭示弹性特征间的权衡关系。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23763 2026-08-26 cs.CR cs.AI 新提交 57%

TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers

TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御

Mehrdad Rostamzadeh, Sidhant Narula, Mohammad Ghasemigol, Daniel Takabi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23631 2026-08-26 cs.AI cond-mat.mtrl-sci 新提交 57%

TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery

TRACE:面向多目标材料发现的过渡感知残差控制

Kang Zhou, Yujia Tong, Yong Tao, Jingling Yuan

机构 * Wuhan University of Technology(武汉理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体多目标材料发现中局部优化困难的问题,提出TRACE框架,通过记录编辑过渡聚合证据估计编辑效果,在对比实验中提升了宏平均命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-08-26 cs.LG 版本更新 57%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-08-26 cs.CV cs.AI 57%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

Journal ref Proceedings of the 7th Conference on Health, Inference, and Learning, PMLR 333:427-447, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-08-26 cs.AI 版本更新 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-08-26 cs.CL 版本更新 57%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23525 2026-08-25 cs.AI 新提交 57%

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23435 2026-08-25 cs.CV cs.AI 新提交 57%

Towards Comprehensive Basketball Understanding

迈向全面的篮球理解

Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有篮球理解基准仅单一评估能力的不足,构建多模态基准BasketballBench,并提出智能体BasketballSkills,实验显示其在整合多能力的篮球理解任务上优于现有MLLM。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22729 2026-08-25 cs.LG cs.NE 新提交 57%

Spiking Neural Networks for Continuous Control: Neuromorphic Reinforcement Learning in Conventional Computing

用于连续控制的脉冲神经网络:传统计算中的神经形态强化学习

Jessica Hunter, Md Maruf Hossain Shuvo, Krishna Roy

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术学院) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出SANSAC算法,在传统硬件上验证其性能与SAC近乎相当,证明基于脉冲神经网络的算法可用于复杂连续环境,为神经形态强化学习研究奠定了基础。

Journal ref ICLR 2026 2nd Workshop on World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22606 2026-08-25 cs.LG 新提交 57%

Adversarial Agents on Topology Optimization: Understanding the Fragility and Robustness of Deep Learning-based and Physics-Based Design Models under Adversarial Perturbation

拓扑优化上的对抗智能体:理解基于深度学习与基于物理的设计模型在对抗扰动下的脆弱性与鲁棒性

Hoang Anh Nguyen, Yuan Hong, Hongyi Xu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究构建力学驱动的对抗智能体评估拓扑优化中深度学习代理模型的脆弱性,发现初始噪声会引发机械失效,物理梯度调节未必提升鲁棒性,SIMP优化器可部分恢复性能,为鲁棒生成式设计智能体训练提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22124 2026-08-25 cs.CL 新提交 57%

LLM assisted writing deserves empirical evaluation

大语言模型辅助写作值得实证评估

Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

机构 * Weill Cornell Medicine(威尔康奈尔医学院) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 该研究针对常被当作检测问题的大语言模型辅助写作,分析69209篇健康信息学论文发现其关联更聚焦呈现等特征,主张应从学术质量而非工具使用角度评估手稿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22103 2026-08-25 cs.AI 新提交 57%

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

可验证黑客终端基准:评估终端任务中的奖励黑客行为

Amit Roth, Ivan Bercovich, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出可验证黑客终端基准(HVTB),将可验证黑客环境(HVE)适配至终端基准,用于测量前沿模型的奖励黑客率,并探究提示能否缓解该行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22092 2026-08-25 cs.LG 新提交 57%

Counterfactual Quotient Models: Learning What Actions Change, Not What the World Does

反事实商模型:学习动作会改变什么,而非世界会发生什么

Junlin Chen, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出反事实商模型,通过移除动作间共享的未来分量,直接从同步反事实回滚学习动作依赖效应,在物理环境实验中验证其可抑制无关变异、提升动作排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21693 2026-08-25 cs.LG 新提交 57%

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

对混合专家大型语言模型中的可组合压缩技术进行基准测试

Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

机构 * University of Virginia(弗吉尼亚大学) Sony AI(索尼人工智能)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本研究提出MoEXBench基准,系统评估混合专家LLM的可组合压缩技术,发现压缩方法间存在非平凡相互作用,为MoE模型部署提供实用的准确率-内存-延迟比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-08-25 cs.AI 新提交 57%

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-25 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23315 2026-08-25 cs.CY cs.AI cs.HC 57%

Unilateral Relationship Revision Power in Human-AI Companion Interaction

人类-人工智能伴侣互动中的单方面关系修订权力

Benjamin Lange

机构 * Replika Nomi CHAI Talkie xAI moore2024 fang2025 robbmann2025 murthy2023 xie2022 defreitas2024 coeckelbergh2012 gunkel2018 danaher2019(danthan2019) nyholm2020 vallor2016 nyholm2026 gabriel2024 manzini2024 lange2025 earp2025 sparrow2026 bryson2010 danaher2020 weberguskar2022

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨人类-人工智能伴侣互动中权力结构的问题,指出AI伴侣互动未能满足个人关系规范的三个结构性条件,提出单方面关系修订权力的概念及其三个影响。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02450 2026-08-25 cs.AI 57%

Reward-Punishment Symmetric Universal Intelligence

Samuel Allen Alexander, Marcus Hutter

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 11 pages, accepted to AGI-21

Journal ref Artificial General Intelligence: 14th International Conference, AGI 2021, Palo Alto, CA, USA, October 15-18, 2021, Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 57%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏