arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-03 至 2026-03-03 共收录 299 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 64 篇

2603.00318 2026-03-03 cs.CR cs.AI 83%

AESP: A Human-Sovereign Economic Protocol for AI Agents with Privacy-Preserving Settlement

AESP:面向AI代理的人类主权经济协议:具有隐私保护的结算

Jian Sheng Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 AESP是一种面向AI代理的人类主权经济协议,通过五种机制确保代理在经济上具备能力但不具有主权,同时实现隐私保护和高效结算。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12282 2026-03-03 cs.AI cs.LG 82%

AISSISTANT: Human-AI Collaborative Review and Perspective Research Workflows in Data Science

AIssistant: 人机协作的数据科学科研与视角研究工作流

Sasi Kiran Gaddipati, Farhana Keya, Gollam Rabby, Sören Auer

机构 * TIB Leibniz Information Centre for Science and Technology(图灵信息科学与技术研究所) L3S Research Center(L3S研究中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 AIssistant通过人机协作框架提升数据科学科研与视角研究的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00822 2026-03-03 cs.SE cs.AI 81%

ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files

ContextCov: 从代理指令文件中推导并强制执行可执行约束

Reshabh K Sharma

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 ContextCov通过从代理指令文件中推导并强制执行可执行约束,解决代理在执行复杂软件任务时因上下文漂移导致的技术债务问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02081 2026-03-03 cs.DB cs.AI cs.CL cs.LG cs.MA 80%

GenDB: The Next Generation of Query Processing -- Synthesized, Not Engineered

GenDB:查询处理的下一代——合成而非工程

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 GenDB利用大语言模型合成查询执行代码,以替代传统复杂的查询处理引擎,实现更高效和定制化的查询处理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 79%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 79%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01024 2026-03-03 cs.HC cs.AI cs.MA 79%

SimAB: Simulating A/B Tests with Persona-Conditioned AI Agents for Rapid Design Evaluation

SimAB:基于人格条件化AI代理的A/B测试模拟用于快速设计评估

Tim Rieder, Marian Schneider, Mario Truss, Vitaly Tsaplin, Alina Rublea, Sinem Dere, Francisco Chicharro Sanz, Tobias Reiss, Mustafa Doga Dogan

机构 * ETH Zurich(苏黎世联邦理工学院) Adobe(Adobe公司) Adobe Research(Adobe研究)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 SimAB通过人格条件化AI代理模拟A/B测试,实现快速设计评估,准确率达67%,在高置信度案例中提升至83%。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 79%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11332 2026-03-03 cs.DC cs.MA 79%

UFO3: Weaving the Digital Agent Galaxy

UFO3:编织数字代理银河

Chaoyun Zhang, Liqun Li, He Huang, Chiming Ni, Bo Qiao, Si Qin, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 UFO3通过统一异构设备,实现高效且健壮的任务编排,提升跨设备协作与智能整合。

Comments We developed UFO$^3$ as a fully engineered system with over 73K lines of code, encompassing agent implementations and integrations for Windows, Linux, and Android mobile devices. The entire project is open-sourced at https://github.com/microsoft/UFO/, accompanied by detailed documentation and tutorials at https://microsoft.github.io/UFO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16179 2026-03-03 cs.AI cs.LG 79%

EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

EnterpriseBench Corecraft: 在高保真RL环境中训练通用智能体

Sushant Mehta, Logan Ritchie, Suhaas Garre, Ian Niebres, Nick Heiner, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 在高保真RL环境中训练智能体,通过CoreCraft环境验证其在多步骤领域任务中的泛化能力,提升任务通过率并转移至多个基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01189 2026-03-03 cs.RO cs.HC 78%

Agent-Based Simulation of Trust Development in Human-Robot Teams: An Empirically-Validated Framework

基于代理的机器人团队信任发展模拟:一个经实证验证的框架

Ravi Kalluri

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个经实证验证的代理模型,用于模拟人类-机器人团队中的信任动态,揭示了机器人可靠性对信任和绩效的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01146 2026-03-03 cs.LO 78%

Uniform Agent-interpolation of Distributed Knowledge

分布式知识的统一代理插值

Youan Su

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种纯语法算法,用于确定具有分布式知识的模态逻辑K、KD和KT的统一插值公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 78%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 Agent评测 :agent(title,abstract)

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13772 2026-03-03 cs.GT 78%

Quantile agent utility and implications to randomized social choice

分位数代理效用及其对随机社会选择的影响

Ioannis Caragiannis, Fabian Frank, Sanjukta Roy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出分位数代理效用概念,通过比较代表者来评估随机结果,展示了在随机社会选择中效率、公平和无策略性可以同时满足的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 77%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01864 2026-03-03 cs.CV cs.RO 75%

Streaming Real-Time Trajectory Prediction Using Endpoint-Aware Modeling

基于端点意识建模的流式实时轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种基于端点意识建模的轻量高效流式轨迹预测方法,通过连续时间上下文传播提升预测精度并降低推理延迟,适用于自动驾驶场景。

Comments WACV 2026 Oral. Project Page at https://a-pru.github.io/seam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01023 2026-03-03 cs.RO cs.AI 74%

An Open-Source Modular Benchmark for Diffusion-Based Motion Planning in Closed-Loop Autonomous Driving

面向闭环自动驾驶的开源模块化扩散运动规划基准

Yun Li, Simon Thompson, Yidu Zhang, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(信息科学与技术研究生学校,东京大学) TIER IV, Inc.(TIER IV公司)

专题命中 Agent评测 :planning(title);分类 cs.AI

AI总结 本研究提出开源模块化扩散运动规划基准,通过分解单体规划器并实现原生C++去噪循环,实现实车部署中运行时可配置的求解器参数和去噪过程的可观测性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 73%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI 73%

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 73%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI 70%

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00960 2026-03-03 cs.CR cs.AI 70%

AWE: Adaptive Agents for Dynamic Web Penetration Testing

AWE:动态网络渗透测试的自适应代理

Akshat Singh Jaswal, Ashish Baghel

机构 * Stux Labs(Stux实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AWE通过内存增强的多代理框架,在动态网络渗透测试中实现高准确性和效率,针对注入类漏洞取得显著成果。

Journal ref Workshop on LLM Assisted Security and Trust Exploration (LAST-X), co-located with NDSS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00058 2026-03-03 cs.CY cs.AI 70%

PaperRepro: Automated Computational Reproducibility Assessment for Social Science Papers

PaperRepro: 社会科学论文的自动化计算可重复性评估

Linhao Zhang, Tong Xia, Jinghua Piao, Lizhen Cui, Yong Li

机构 * Shandong University, Zhongguancun Academy, China(山东大学中关村学院) Tsinghua University Beijing China(清华大学北京) Shandong University Jinan China(山东大学济南) Tsinghua University(清华大学) Shandong University(山东大学) Tsinghua University, Zhongguancun Academy, China(清华大学中关村学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 PaperRepro通过多代理方法提升社会科学论文的自动化可重复性评估,实现性能提升21.9%并推出分层基准

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23166 2026-03-03 cs.CV 67%

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

AgentVista: 评估在超挑战性现实视觉场景中的多模态代理

Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

机构 * Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(abstract);tool use(abstract)

AI总结 AgentVista 是一个评估多模态代理在超挑战性现实视觉场景中能力的基准,通过真实场景和复杂工具交互任务揭示现有模型在长时间多模态工具使用方面的不足。

Comments The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00797 2026-03-03 cs.HC 67%

From Dyads to Groups: Rethinking Emotional Support with Conversational AI

从二元关系到群体:重新思考基于对话AI的情感支持

Yuqing Hu, Wendao Xue, Yifan Yu, Yong Tan

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本研究探讨群体AI支持是否比单个AI支持更有效,通过实验验证群体AI增强用户感知支持效果的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 67%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02192 2026-03-03 cs.RO 67%

A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms

一种集中式与分布式强化学习控制在软机器人手臂中的定量比较

Linxin Hou, Qirui Wu, Zhihang Qin, Neil Banerjee, Yongxin Guo, Cecilia Laschi

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文比较了集中式与分布式强化学习在软机器人手臂控制中的性能,发现分布式策略在样本效率和鲁棒性上更优,但集中式策略在训练时间上更高效。

Comments 7 pages, 4 figures, 2 tables, accepted by RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16234 2026-03-03 cs.AI cs.CL cs.LG 67%

ScholarEval: Research Idea Evaluation Grounded in Literature

ScholarEval: 基于文献的研究思想评估

Hanane Nour Moussa, Patrick Queiroz Da Silva, Daniel Adu-Ampratwum, Alyson East, Zitong Lu, Nikki Puccetti, Mingyi Xue, Huan Sun, Bodhisattwa Prasad Majumder, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy, The Ohio State University(俄亥俄州立大学药物化学与药理学系) Department of Wildlife, Fisheries, and Conservation Biology, The University of Maine(缅因大学野生动物、渔业与保育生物学系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦格尼恩脑研究 institute) Center for Cognitive and Behavioral Brain Imaging, The Ohio State University(俄亥俄州立大学认知与行为脑成像中心) Department of Chemistry, University of Wisconsin-Madison(威斯康星大学麦迪逊分校化学系) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 ScholarEval通过基于文献的评估框架,有效评估研究思想的实证有效性与创新性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02119 2026-03-03 cs.AI cs.GT cs.LG 62%

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

笔算谜题基准:多步骤可验证推理的基准

Justin Waugh

机构 * Approximate Labs

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 62%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏