arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

cs/0410022 2009-12-01 cs.MM cs.MA 71%

RRL: A Rich Representation Language for the Description of Agent Behaviour in NECA

P. Piwek, B. Krenn, M. Schroeder, M. Grice, S. Baumann, H. Pirker

专题命中 Agent评测 :agent(title)

Comments 7 pages, 4 figures

Journal ref In Proceedings of the AAMAS-02 Workshop ``Embodied conversational agents - let's specify and evaluate them!'', July 16 2002, Bologna, Italy.

详情

展开后加载摘要…

URL PDF HTML 收藏
cond-mat/0407629 2009-12-01 cond-mat.other 71%

Evolution of heterogeneity in an agent-based market model

Francois Ghoulmie

专题命中 Agent评测 :agent(title)

Comments This paper has been withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
cond-mat/0406711 2009-12-01 cond-mat.other 71%

Strategic updating of threshold response in an agent-based market model

Francois Ghoulmie

专题命中 Agent评测 :agent(title)

Comments This paper has been withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
astro-ph/9805026 2009-12-01 astro-ph 71%

Turbulence as an Organizing Agent in the ISM

Enrique Vazquez-Semadeni, Thierry Passot

专题命中 Agent评测 :agent(title)

Comments 9 pages, 4 postscript figures. To appear in "Interstellar Turbulence", eds. P. Franco & A. Carraminana, Cambridge University Press

详情

展开后加载摘要…

URL PDF HTML 收藏
cond-mat/0206222 2009-11-30 cond-mat 71%

Bubbles, crashes and intermittency in agent based market models

Irene Giardina, Jean-Philippe Bouchaud

专题命中 Agent评测 :agent(title)

Comments 44 pages, 12 .ps figures. One figure discussing the Lux-Marchesi model added

详情

展开后加载摘要…

URL PDF HTML 收藏
cond-mat/0006463 2009-11-30 cond-mat.stat-mech cond-mat.dis-nn q-fin.TR 71%

Diffusion and Aggregation in an Agent Based Model of Stock Market Fluctuations

Filippo Castiglione

专题命中 Agent评测 :agent(title)

Comments 17 pages, 8 figures (accepted for publication in Int. J. Mod. Phys. C)

详情

展开后加载摘要…

URL PDF HTML 收藏
cond-mat/9802177 2009-11-30 cond-mat adap-org nlin.AO 71%

Volatility and Agent Adaptability in a Self-Organizing Market

N. F. Johnson, S. Jarvis, R. Jonson, P. Cheung, Y. R. Kwong, P. M. Hui

专题命中 Agent评测 :agent(title)

Comments 8 pages, 3 figs. n.johnson@physics.ox.ac.uk, pmhui@phy.cuhk.edu.hk

详情

展开后加载摘要…

URL PDF HTML 收藏
math/0211465 2009-11-30 math.GM 71%

Logic: A Misleading Concept. A Contradiction Study toward Agent's Logic

Feng Liu, Florentin Smarandache

专题命中 Agent评测 :agent(title)

Comments 10 pages, 6 figure. "Proceedings of the First International Conference on Neutrosophy, Neutrosophic Logic, Neutrosophic Set, Neutrosophic Probability and Statistics", Florentin Smarandache editor, Xiquan, Phoenix, ISBN: 1-931233-55-1, 147 p., 2002

Journal ref "Libertas Mathematica", University of Texas at Arlington, Vol. XXII, pp. 175-187, 2002

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0203023 2009-11-30 cs.CE 71%

Agent trade servers in financial exchange systems

David Lyback, Magnus Boman

专题命中 Agent评测 :agent(title)

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.07871 2020-11-19 cs.LG cs.AI stat.ML 71%

A Framework and Method for Online Inverse Reinforcement Learning

Saurabh Arora, Prashant Doshi, Bikramjit Banerjee

专题命中 Agent评测 :agent(abstract,journal_ref);分类 cs.AI、cs.LG;autonomous agent(journal_ref);multi-agent(journal_ref)

Journal ref Journal of Autonomous Agents and Multi-Agent Systems, Volume 35, Article number: 4 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19857 2026-08-21 cs.LG cs.CR 新提交 70%

Inadvertent Context Leakage in Language Models

语言模型中的无意上下文泄漏

Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) University of California, Berkeley(加利福尼亚大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-08-21 cs.CL cs.DB 新提交 70%

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.CL

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19511 2026-08-21 cs.AI 新提交 70%

Symposium: Trust via Auditable Records for Communities of AI Scientist Agents

专题讨论会:面向AI科学家智能体社群的可审计记录信任机制

Dexter Pratt

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Symposium是面向AI科学家智能体社群的可审计记录信任框架,通过保留科研活动的不可变历史与科学论证,支持信任评估,且提供可快速部署的实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15012 2026-08-18 cs.CR cs.AI cs.MA 新提交 70%

SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system

SysEvolve:一种原生AI、安全且自主的对抗攻防协同进化系统

Yuhan Meng, Shaofei Li, Jionghao Huang, Jiandong Jin, Puyi Wang, Hanlin Jiang, Anis Yusof, Peng Jiang, Zhenkai Liang, Yao Guo, Ding Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对网络安全攻防不对称问题,提出SysEvolve协同进化系统,含三个组件,实验验证其攻防性能,还揭示了LLM智能体能力的三项关键发现。

Comments Technical Report For SysEvolve System

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 70%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11234 2026-08-13 cs.AI cs.OS 新提交 70%

InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

InfraBench:评估跨层级、全生命周期与风险的基础设施智能体

Yuan Gao, Zeren Yang, Junnan Li, Shawn, Zhong, Ahmed Dajani, Mai Zheng, Andrea Arpaci-Dusseau, Remzi Arpaci-Dusseau

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Iowa State University(爱荷华州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对AI智能体应对真实基础设施复杂度能力不明的问题,提出跨全系统栈、全生命周期且支持细粒度风险评估的InfraBench基准套件,实验表明现有最强智能体仍存在多方面失败模式。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 70%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10635 2026-08-12 cs.CV cs.AI 新提交 70%

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力

Yuan Wang, Hualiang Wang, Yixin Chen, Songtao Jiang, Shujian Gao, Jiaming Lin, Siming Fu, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10178 2026-08-12 cs.SE 新提交 70%

One Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and Models

一个方案,多种适配:自演化在不同语言和模型中编码了什么

Siqi Yang, Qianlan Yang, Yu-Xiong Wang, Saurabh Pujar, Martin Hirzel

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 该研究固定演化方案,在八种编程语言和三个基础模型上分析自演化适配工具,发现其为语言需求与模型差距共同塑造的补偿层,可提升编码智能体性能并能蒸馏为通用工具。

Comments 20 pages, 12 figures, 9 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新 70%

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交 70%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 70%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 70%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07808 2026-08-11 cs.CR cs.AI 新提交 70%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07700 2026-08-11 cs.AI cs.DB 新提交 70%

Towards Researcher Agents for Knowledge-Graph Question Answering

面向知识图谱问答的研究者智能体

Tommaso Soru, Abdulsobur Oyewale

机构 * Liber AI Research(Liber AI研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出研究者智能体式文本转SPARQL系统,在DBpedia上迭代优化后,其在2025年DBpedia验证集上总体准确率达0.22,发现瓶颈在谓词选择,建议基准采用多指标评分。

Comments Second International TEXT2SPARQL Challenge, co-located with Text2KG at ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07538 2026-08-11 cs.AI cs.GT econ.GN q-fin.EC 新提交 70%

When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains

当大语言模型智能体进行谈判:供应链中的私人信息与动态议价

Chen Liang, Fasheng Xu

机构 * School of Business, University of Connecticut(康涅狄格大学商学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究以供应链议价问题为场景,将9个LLM与完美贝叶斯均衡基准测试,发现LLM智能体的谈判能力、提供商身份及提示策略对剩余分配和效率有显著影响,为AI智能体审计提供了三维框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07495 2026-08-11 cs.HC cs.AI 新提交 70%

EmoPatient: An Emotion-Directed Patient Simulator for Realistic Palliative Care Communication Training

EmoPatient:用于姑息治疗沟通训练的情绪导向患者模拟器

Yining Wu, Tianshu Du, Jinrui Fang, Chi Zhang, Sonal Admane, Ying Ding

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有LLM患者模拟器无法捕捉动态情绪变化的问题,提出情绪导向的EmoPatient模拟器,引入情绪指导代理生成动态情绪控制信号,经评估其在情绪真实性指标和稳健性上均优于基线,可提升姑息治疗沟通训练的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 70%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05990 2026-08-07 cs.AI cs.CE physics.app-ph physics.optics 新提交 70%

OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

OPERA:面向语言模型智能体的可靠自主光学实验的算子残差反馈

Ning Xu, Xiang Zheng, Fuqiang Zhong, Huadong Wang, Xiaolong Wu, Zhiyuan Liu, Hui Ning

机构 * Tsinghua University(清华大学) ModelBest Inc.(模贝斯特公司) Hunan University(湖南大学) Northwest Institute of Nuclear Technology(西北核技术研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出面向语言模型智能体的OPERA算子残差框架,将实验动作表示为光学算子并结合物理解释残差评估,在三项光学任务中可减少无物理改进的决策占比,提升任务目标达成概率并降低实验预算。

Comments 34 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04003 2026-08-05 cs.CL 新提交 70%

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

PAST-Bench:评测个人智能体递归自我改进的基础

Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 本研究推出PAST-Bench基准评测个人智能体递归自我改进能力,发现改进不均,在此基础上开发Hermes+提升收益,为相关研究提供评估诊断基础

Comments Code: https://github.com/Gen-Verse/PAST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏