arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1187 篇

2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 78%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10866 2026-08-12 astro-ph.SR astro-ph.IM 新提交 78%

Spectroscopic Binary Detection as Agent-Callable Tools: Detecting 40,000+ Main-Sequence Binary Candidates from SDSS DR19 APOGEE Spectra

作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体

Serat M. Saad, Yuan-Sen Ting

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。

Comments 23 pages, 16 figures, submitted to OJAp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29191 2026-08-03 cs.SC 新提交 78%

A Proof of the Dittert Conjecture in Dimension 4 via an Exact Constrained Sum-of-Squares Certificate

通过智能体引导的精确平方和证书证明4维下的Dittert猜想

Jinhui Li, Beibei Xiong, Zhengfeng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29546 2026-08-03 nlin.AO 新提交 78%

Agent-based dynamics of criminal propensity

基于智能体的犯罪倾向动力学

Daniel Holland, Abigail Saynor, Evelyn Svingen, Galane Luo

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28915 2026-08-03 physics.soc-ph cs.SI math-ph math.MP 新提交 78%

An agent-based model of the formation and evolution of common ground

基于智能体的共同基础形成与演化模型

Mengbin Ye, Wooseok Jung, Tony J. Mathew, Lorenzo Zino, Yoshihisa Kashima

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。

Comments Submission for a journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28186 2026-07-31 cs.CV 新提交 78%

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain

借助图像外信息思考:由时空信息增益驱动的农田分割智能体

Haiyang Wu, Weiliang Mu, Zhuofei Du, Dandan Zhong, Kaijie Shi, Haifeng Li, Chao Tao

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24822 2026-07-29 cs.IR 新提交 78%

A Position Paper on Recommender Systems in the Era of Autonomous Agents

关于自主智能体时代推荐系统的立场文件

Aixin Sun

专题命中 Agent评测 :autonomous agent(title,abstract)

AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。

Comments Accepted to the ACM RecSys 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22939 2026-07-28 eess.AS 新提交 78%

Speech Entrainment in Multi-Party Conversations with a Digital Agent

多方对话中与数字代理的语音同步

Nicholas Mehlman, Kaitlin Zareno, Kleanthis Avramidis, Anfeng Xu, Shrikanth Narayanan

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究人类群体与数字代理多方互动中的语音同步效应,通过收集含成人及家庭会话的独特数据集,考虑多种同步特征,发现个体局部与人同步,全局及与代理的同步有限且依群体而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-07-27 cs.MA 新提交 78%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnicov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20845 2026-07-24 math.OC 新提交 78%

Mean field and N-agent games for optimal relative consumption-investment with jump risk and common noise

具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈

Yiming Jiang, Fuxing Li, Yawei Wei, Zimeng Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18557 2026-07-22 physics.geo-ph 新提交 78%

AGENTS4GEOS: agentic platform for open-source multi-physics simulation

AGENTS4GEOS:用于开源多物理场模拟的智能体平台

Adriano M. A. Côrtes, Roberto M. Velho, Fernando A. Rochinha, Alvaro L. G. A. Coutinho, Mauricio Araya-Polo, Hervé Gross

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。

Comments 14 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17347 2026-07-21 cs.IR 新提交 78%

Adapting Embedding Models for Agent Capability Retrieval

使嵌入模型适应智能体能力检索

Tingwei Chen, Yunxiao Shi, Zhengdong Chu, Qingsong Wen, Min Xu

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究如何让一般文本检索的现成模型适应智能体能力检索,通过微调三个模型在特定数据集上训练,测试其在未训练目录上的迁移能力,结果显示适应对两个目录均有帮助。

Comments Accepted for oral presentation at the AgentSearch Workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17214 2026-07-21 math.OC 新提交 78%

A Principal-Agent Mean-Field Game Model of Insurance with Risk Interdependence

具有风险相互依存性的保险委托-代理平均场博弈模型

Asaf Cohen, Ruolan He, Mingyan Liu

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究道德风险、内生参与和战略风险相互依存下的保险合同设计问题,用异质平均场博弈近似战略互动,建立下层均衡存在性与唯一性,嵌入上层优化问题,证明相关均衡存在,扩展到有限合同菜单,表明多合同筛选可提高委托人预期收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 78%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09420 2026-07-13 q-bio.PE 新提交 78%

PesTwin: A modular agent-based framework for pest and vector population control

PesTwin:一种用于害虫和病媒种群控制的基于模块化代理的框架

Andrea De Antoni, Giovanni Iacca, Andrea Pugliese, Anna Strampelli, Gerard Terradas, Matteo Rucco, Andrew Hammond

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对基因控制技术建模工具滞后问题,提出PesTwin框架,可跨物种等模拟基因控制技术,捕捉多种因素。经与实验室数据验证后可扩展到田间场景,能在基因控制系统实际应用前进行模拟测试,助力相关决策,缩短研发到应用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07584 2026-07-09 cs.NI 新提交 78%

PHaul: A PPO-based forwarding agent for Sub6 enhanced Integrated Access and Backhaul networks

PHaul:一种用于Sub6增强型综合接入与回传网络的基于近端策略优化(PPO)的转发代理

Jorge Pueyo, Daniel Camps-Mur and, Miguel Catalan-Cid

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究Sub6增强型IAB网络的转发问题,提出PHaul,结合离线启发式算法与基于PPO的在线DRL代理,利用网络数字孪生采样更新映射,相比替代算法,能提升吞吐量效率和公平性,且对拓扑差异有鲁棒性。

Journal ref IEEE Transactions on Network and Service Management, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 78%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 78%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 78%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31613 2026-07-01 cs.CV cs.RO 新提交 78%

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto

机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26074 2026-06-25 cs.GT 新提交 78%

Strategyproof Facility Location and Committee Selection with Mixed Max and Sum Agent Types

混合最大和求和代理类型的策略性设施选址与委员会选择

Yue Gruszecki, Elliot Anshelevich

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对代理具有最大型或求和型成本函数的策略性设施选址问题,设计确定性策略证明机制,并证明在代理类型私有但位置已知时近似比为(3-2/k),在位置私有且位于直线度量时近似比为3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23070 2026-06-23 q-fin.TR 新提交 78%

Mitigating Adverse Selection in Concentrated Liquidity AMMs with Dynamic Fees: An Agent-Based Model Approach

缓解集中流动性AMM中的逆向选择:基于动态费用的代理建模方法

Daniele Maria Di Nosse, Fabrizio Lillo

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对Uniswap v3等集中流动性AMM中流动性提供者面临的逆向选择成本,提出基于波动率和订单流毒性的动态费用机制,通过代理建模验证其可补偿损失而非直接降低损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23408 2026-06-23 math.OC cs.NA math.NA 新提交 78%

Finite difference methods for a continuous-time heterogeneous agent model with recursive utility

具有递归效用的连续时间异质主体模型的有限差分方法

Yves Achdou, Qing Tang

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对Epstein-Zin递归效用下的连续时间异质主体模型,提出Howard-Newton和Howard-Tarski-Kantorovich算法求解离散化的HJB方程,证明算法收敛性及解的存在性,并给出先验误差估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 78%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18591 2026-06-18 cs.CV 新提交 78%

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

桥接创意意图与视觉质量:基于创作者驱动的循环视频生成与代理反馈循环

Denis Savytski, Aiden Lei, Heding Liu, Warren Yang, Sihan Liang, Alexander Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) The Harker School(哈克学校) Basis Independent Silicon Valley(硅谷贝斯独立学校) Saratoga High(萨拉托加高中)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 提出CHIEF框架,通过人类-AI协作的迭代视频精炼,结合创作者驱动和代理主观反馈,提升长视频的叙事连贯性与创意方向。

Comments Accepted to the Workshop on Human-AI Co-Creativity at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18121 2026-06-17 cs.MA cs.IT math.IT 新提交 78%

On the Reliability of Networks of AI Agents: Density Evolution, Stopping Sets, and Architecture Optimization

AI代理网络的可靠性:密度演化、停止集与架构优化

Ehsan Aghazadeh, Hossein Pishro-Nik

专题命中 Agent评测 :AI agent(title);agent(abstract)

AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13749 2026-06-15 cs.MA 新提交 78%

Large Language Models as Supervised Extraction Assistants: Lowering the Barrier to Documentation Standard Adoption in Agent-Based Modelling

大型语言模型作为监督式提取助手:降低基于智能体建模中文档标准采纳的门槛

Peer-Olaf Siebers, Christopher Frantz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探索利用大型语言模型(LLMs)辅助自动化ABM文档标准(如RAT-RS)的采纳,通过四个LLMs从已发表论文中提取报告,发现LLMs在描述性任务上表现可靠,但在解释性和评估性任务上存在局限,并提出了何时依赖LLM、何时需要人工监督的实用启发式方法。

Comments 17 pages, accepted for publication at the Social Simulation Conference 2026, see https://www.durham.ac.uk/research/institutes-and-centres/research-methods/social-simulation-conference-2026/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14331 2026-06-15 physics.soc-ph cond-mat.stat-mech econ.GN q-fin.EC 新提交 78%

Wealth Inequality and Planetary Boundaries in a Stylized Agent-Based Model

一个基于主体的风格化模型中的财富不平等与行星边界

Thomas Valade, Michael Benzaquen, Matthieu Cristelli, Stanislao Gualdi, Pierre Lenders

专题命中 Agent评测 :agent(title,abstract)

AI总结 通过构建异质主体模型,研究财富不平等如何阻碍绿色转型,发现超过一定阈值后经济锁定在棕色状态,并评估了不同财政政策的效果。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13639 2026-06-12 cs.MA 新提交 78%

Tuning Agent-Based Predator-Prey Models Toward Lotka-Volterra Dynamics

将基于智能体的捕食者-猎物模型调谐至洛特卡-沃尔泰拉动力学

Corinna Mandl, Siddharth Chaturvedi, Marcel van Gerven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究通过调整环境与种群参数,使基于智能体的捕食者-猎物模型产生类似洛特卡-沃尔泰拉方程的周期性振荡,并利用基于特征的损失函数优化参数。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09375 2026-06-09 physics.soc-ph 新提交 78%

An Agent-Based Model for Migration Decision-Making Under Higher Frequency of Extreme Climate Events

极端气候事件频率增加下的迁移决策基于智能体的模型

Valentina Antonaccio Guedes, Rafael Prieto-Curiel

专题命中 Agent评测 :agent(title,abstract)

AI总结 构建基于智能体的模型,通过感知风险、迁移愿望和迁移能力的共同演化,揭示气候冲击如何非线性地影响迁移决策,并导致脆弱群体陷入困境。

Comments 44 pages including appendix, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏