arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

1609.05521 2018-01-30 cs.AI cs.LG 79%

Playing FPS Games with Deep Reinforcement Learning

Guillaume Lample, Devendra Singh Chaplot

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments The authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16809 2025-07-25 cs.CL 78%

LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs

Da-Chen Lian, Ri-Sheng Huang, Pin-Er Chen, Chunki Lim, You-Kuan Lin, Guan-Yu Tseng, Zi-Cheng Yang, Zhen-Yu Lin, Pin-Cheng Chen, Shu-Kai Hsieh

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);multi-agent(abstract);分类 cs.CL

Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06323 2025-03-11 cs.AI cs.MA 78%

Higher-Order Belief in Incomplete Information MAIDs

Jack Foxabbott, Rohan Subramani, Francis Rhys Ward

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

Journal ref 24th International Conference on Autonomous Agents and Multiagent Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 78%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18745 2026-08-26 cs.RO 版本更新 78%

A study on the effects of mixed explicit and implicit communications in human-artificial-agent interactions

人类-人工智能代理交互中混合显性与隐性沟通效果的研究

Ana Christina Almada Campos, Bruno Vilhena Adorno

机构 * The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探讨了人类与人工智能代理交互中混合显性与隐性沟通的效果,发现混合沟通能提升代理的接受度和透明度,但对任务执行时间影响不显著。

Comments Main paper with 33 pages, 16 figures, 5 tables. Supplementary material with 39 pages, 44 figures, 2 tables. Submitted to Intelligent Service Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22818 2026-08-25 math.OC 新提交 78%

Backward SDE characterization of the finite horizon Principal-Agent problem

有限周期委托代理问题的倒向随机微分方程刻画

Nizar Touzi, Yuxing Huang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过倒向随机微分方程刻画有限周期委托代理问题的委托人值函数,绕开完全非线性HJB方程,可处理代理人面临机制切换控制的新型委托代理问题。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22400 2026-08-25 cond-mat.mtrl-sci cs.MA 新提交 78%

Diagnosing and narrowing the simulation-to-real gap in powder X-ray diffraction with a wet-dry agentic loop

利用干湿智能体循环诊断并缩小粉末X射线衍射中的模拟到真实差距

Shaoguang Wang, Weiyu Guo, Ben Fei, Xiaohong Shao, Zhihui Wang, Wanli Ouyang

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 该研究针对粉末X射线衍射的模拟到真实差距,提出整合实测图谱微调等技术的Xtalyst智能体系统,通过干湿循环优化,提升了物相分析的准确性与覆盖度。

Comments 72 pages, 15 figures, 7 supplementary tables; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08401 2026-08-25 econ.GN cs.CR q-fin.EC q-fin.ST stat.CO 版本更新 78%

Is Decentralized Finance Actually Decentralized? An Interdisciplinary Framework Integrating Network Theory, Agent-Based Simulation, and Longitudinal Evidence from Aave, GHO Issuance, and Cross-Chain Expansion

去中心化金融真的是去中心化的吗?整合网络理论、基于智能体的模拟以及来自Aave、GHO发行和跨链扩张的纵向证据的跨学科框架

Ziqiao Ao, Lin William Cong, Gergely Horvath, Luyao Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究构建跨学科框架,结合网络理论、智能体模拟与Aave等的纵向数据,发现DeFi的去中心化四维维度会背离,且GHO发行与跨链扩张对DeFi的参与度、集中度影响存在差异,可为相关评估提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20996 2026-08-24 math.OC 新提交 78%

Bridging Semantics and Behavior: An Agent-Based Evolutionary Model of Topic Competition with BERTopic

衔接语义与行为:基于智能体的BERTopic主题竞争演化模型

Blekanov I., Gubar E., Fan X

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究提出结合BERTopic、演化博弈论与智能体模拟的框架,揭示社交媒体主题传播的微观机制,复现真实传播趋势,为在线集体行为研究及相关应用提供支撑。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 78%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :planning(title,abstract)

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18657 2026-08-20 econ.GN q-fin.EC 新提交 78%

Accounting for intra-household joint travel in agent-based transport simulations

在基于智能体的交通模拟中考虑家庭内部联合出行

Javaudin Lucas, Araldo Andrea, Coulombel Nicolas

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究针对基于智能体的交通模拟忽略家庭联合出行的问题,提出三步整合方法,经巴黎数据验证可复现相关出行特征,助力更可靠评估差异化交通政策。

Comments Submission for hEART 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 78%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17733 2026-08-19 cs.CC cs.MA 新提交 78%

The Influence of Agent Models on the Complexity of Bus Routing

智能体模型对公交线路规划问题复杂度的影响

Eva Deltl, Christian Komusiewicz, Jurek Rostalsky, Johannes Schröder, Luca Pascal Staus

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究分析公交线路规划问题的复杂度,发现智能体成本模型、是否允许智能体选择步行等因素会影响问题难度,相关结果还证明了其NP-hard性与参数化难解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17614 2026-08-19 cs.MA cs.SY eess.SY 新提交 78%

Adaptive Incentive Design in Dynamic Principal-Agent Problem via Kernelized Bandits

基于核化多臂老虎机的动态委托代理问题中的自适应激励设计

Arghya Mallick, Anuj S. Vora, Sergio Grammatico, Peyman Mohajerin Esfahani

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对动态委托代理问题的现有局限,提出引入随机效用模型的Heteroscedastic GP-UCB算法,建立了累积遗憾界,并在V2G激励设计中验证了其更优的经济性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19359 2026-08-18 econ.TH cs.GT 版本更新 78%

How damaging is zero-sum thinking to an agent's interests when the world is positive-sum?

零和思维对代理利益的损害在正和世界中有多大?

Shaun Hargreaves Heap, Mehmet Mars Seven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09546 2026-08-18 q-fin.TR cs.SI 版本更新 78%

A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency Trading

一种用于指导零样本加密货币交易的反思型大语言模型智能体

Yuan Li, Bingqiao Luo, Qian Wang, Nuo Chen, Xu Liu, Bingsheng He

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。

Comments Published at EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 78%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 78%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10866 2026-08-12 astro-ph.SR astro-ph.IM 新提交 78%

Spectroscopic Binary Detection as Agent-Callable Tools: Detecting 40,000+ Main-Sequence Binary Candidates from SDSS DR19 APOGEE Spectra

作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体

Serat M. Saad, Yuan-Sen Ting

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。

Comments 23 pages, 16 figures, submitted to OJAp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 78%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29191 2026-08-03 cs.SC 新提交 78%

A Proof of the Dittert Conjecture in Dimension 4 via an Exact Constrained Sum-of-Squares Certificate

通过智能体引导的精确平方和证书证明4维下的Dittert猜想

Jinhui Li, Beibei Xiong, Zhengfeng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29546 2026-08-03 nlin.AO 新提交 78%

Agent-based dynamics of criminal propensity

基于智能体的犯罪倾向动力学

Daniel Holland, Abigail Saynor, Evelyn Svingen, Galane Luo

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28915 2026-08-03 physics.soc-ph cs.SI math-ph math.MP 新提交 78%

An agent-based model of the formation and evolution of common ground

基于智能体的共同基础形成与演化模型

Mengbin Ye, Wooseok Jung, Tony J. Mathew, Lorenzo Zino, Yoshihisa Kashima

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。

Comments Submission for a journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28186 2026-07-31 cs.CV 新提交 78%

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain

借助图像外信息思考:由时空信息增益驱动的农田分割智能体

Haiyang Wu, Weiliang Mu, Zhuofei Du, Dandan Zhong, Kaijie Shi, Haifeng Li, Chao Tao

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24822 2026-07-29 cs.IR 新提交 78%

A Position Paper on Recommender Systems in the Era of Autonomous Agents

关于自主智能体时代推荐系统的立场文件

Aixin Sun

专题命中 Agent评测 :autonomous agent(title,abstract)

AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。

Comments Accepted to the ACM RecSys 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22610 2026-07-29 cs.HC 78%

Everything Counts: The Managed Omnirelevance of Speech in Human-Voice Agent Interaction

一切都有价值:人类与语音代理互动中语音的受控全相关性

Damien Rudaz, Mathias Broth, Jakub Mlynar

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究探讨了人类与语音代理互动中语音的全相关性问题,分析了人类如何管理代理的轮流发言行为,以及技术进步对这一现象的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22939 2026-07-28 eess.AS 新提交 78%

Speech Entrainment in Multi-Party Conversations with a Digital Agent

多方对话中与数字代理的语音同步

Nicholas Mehlman, Kaitlin Zareno, Kleanthis Avramidis, Anfeng Xu, Shrikanth Narayanan

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究人类群体与数字代理多方互动中的语音同步效应,通过收集含成人及家庭会话的独特数据集,考虑多种同步特征,发现个体局部与人同步,全局及与代理的同步有限且依群体而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10265 2026-07-28 cs.DB 版本更新 78%

TGMS: An Agent-Native Bi-Temporal Graph Management System

TGMS:一种原生代理双时态图管理系统

Xiaofei Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-07-27 cs.MA 新提交 78%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnicov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20845 2026-07-24 math.OC 新提交 78%

Mean field and N-agent games for optimal relative consumption-investment with jump risk and common noise

具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈

Yiming Jiang, Fuxing Li, Yawei Wei, Zimeng Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏