arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-02 至 2026-02-02 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2511.09139 2026-02-02 cs.CV 88%

MACEval: A Multi-Agent Continual Evaluation Network for Large Models

MACEval: 一种用于大型模型的多智能体持续评估网络

Zijian Chen, Yuze Sun, Yuan Tian, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 MACEval通过多智能体持续评估网络,提出新的度量标准以动态评估大型模型,减少评估开销并提升评估效率。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20613 2026-02-02 cs.CL 87%

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

AgentIF-OneDay: 一个面向日常场景的通用AI代理任务级指令遵循基准测试

Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Zhou, Jiaqi Cai, Jiewu Rao, Jiyuan Ren, Keduan Huang, Lucia Zhu Huang, Mingyu Yuan, Naixu Guo, Qicheng Tang, Qinyan Zhang, Shuai Chen, Siheng Chen, Ting Ting Li, Xiaoxing Guo, Yaocheng Zuo, Yaoqi Guo, Yinan Wang, Yinzhou Yu, Yize Wang, Yuan Jiang, Yuan Tian, Yuanshuo Zhang, Yuxuan Liu, Yvette Yan Zeng, Zenyu Shan, Zihan Yin, Xiaobo Hu, Yang Liu, Yixin Ren, Yuan Gong

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 AgentIF-OneDay是一个面向日常场景的通用AI代理任务级指令遵循基准测试,旨在评估一般用户能否利用自然语言指令和AI代理完成多样化日常任务。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 85%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22269 2026-02-02 cs.AI cs.CL cs.LG 85%

JAF: Judge Agent Forest

JAF:裁判代理森林

Sahil Garg, Brad Cheezum, Sridhar Dutta, Vishal Agarwal

机构 * Averlon

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 JAF通过裁判代理森林框架,利用联合推理和集合学习原理,提升主代理的自我改进能力,通过高效的哈希算法优化多样示例选择,改进推理路径探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22288 2026-02-02 cs.HC cs.AI eess.AS eess.IV 83%

PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research

PersonaCite: 基于VoC的可访谈代理合成AI人设用于可验证的用户与设计研究

Mario Truss

机构 * Adobe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 PersonaCite通过检索增强的交互,将AI人设作为证据受限的研究工具,提升用户与设计研究中的可验证性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 81%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22964 2026-02-02 cs.AI 79%

EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning

EvoClinician: 一种通过测试时进化学习进行多轮医学诊断的自进化代理

Yufei He, Juncheng Liu, Zhiyuan Hu, Yulin Chen, Yue Liu, Yuan Sui, Yibo Li, Nuo Chen, Jun Hu, Bryan Hooi, Xinxing Xu, Jiang Bian

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EvoClinician通过测试时进化学习实现多轮医学诊断,采用'诊断-评分-进化'循环提升诊断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22290 2026-02-02 cs.AI 79%

The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

六西格玛代理:通过共识驱动的分解执行实现企业级可靠性

Khush Patel, Siva Surendira, Jithin George, Shreyas Kapale

机构 * Lyzr Research(Lyzr研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 六西格玛代理通过共识驱动的分解执行实现企业级可靠性,显著提升AI系统可靠性并降低成本。

Comments 25 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 79%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 79%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 Agent评测 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 73%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 70%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.09807 2026-02-02 cs.RO cs.AI cs.GT cs.MA 70%

I Know You Can't See Me: Dynamic Occlusion-Aware Safety Validation of Strategic Planners for Autonomous Vehicles Using Hypergames

我无法看到你:基于超游戏的动态遮挡感知的自动驾驶战略规划器安全验证

Maximilian Kahn, Atrisha Sarkar, Krzysztof Czarnecki

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于超游戏理论的动态遮挡风险度量方法和加速安全验证框架,用于提升自动驾驶战略规划器的安全性。

Comments This work is 6 pages long and contains 5 figures. For the supplementary video, see https://youtu.be/-crio3rA_IU

Journal ref 2022 International Conference on Robotics and Automation (ICRA). IEEE, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22701 2026-02-02 cs.AI 70%

Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference

Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理

Emilien Biré, María Santos, Kai Yuan

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20886 2026-02-02 cs.SE cs.LG 62%

IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks

IDE-Bench:通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现

Spencer Mateega, Jeff Yang, Tiana Costello, Shaurya Jadhav, Nicole Tian, Agustin Garcinuño

专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE

AI总结 IDE-Bench通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现,提供首个系统性的多语言全栈环境评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22746 2026-02-02 cs.ET cs.AI 57%

UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region Profiling

UrbanMoE: 一种用于多任务城市区域刻画的稀疏多模态专家混合框架

Pingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao, Qi Jiang, Qingliang Li, Qiuzhan Zhou, Irwin King

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Changchun Normal University(长春师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 UrbanMoE提出了一种稀疏多模态专家混合框架,用于解决多任务城市区域刻画问题,通过多模态特征动态路由实现高效预测,提升了城市分析的性能和可重复性。

Comments 12 pages, 6 figures, 5tables, Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 57%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02883 2026-02-02 cs.LG 57%

A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks

连续离线强化学习导航任务基准测试

Anthony Kobanda, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Inria, Univ. Lille, CNRS, Centrale Lille, UMR 9198-CRIStAL, F-59000 Lille, France(法国里尔大学、法国国家科学研究中心、中央里尔学院、UMR 9198-CRIStAL)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一个连续离线强化学习导航任务基准测试,通过视频游戏场景评估算法性能,解决灾难性遗忘、任务适应和内存效率等关键挑战。

Comments arXiv admin note: text overlap with arXiv:2412.14865

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22633 2026-02-02 cs.NI cs.AI 57%

MCP-Diag: A Deterministic, Protocol-Driven Architecture for AI-Native Network Diagnostics

MCP-Diag:一种确定性的、基于协议的架构用于AI原生网络诊断

Devansh Lodha, Mohit Panchal, Sameer G. Kulkarni

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 MCP-Diag通过确定性翻译层和强制性 elicitation循环,实现高精度的AI原生网络诊断,提升实体提取准确性和上下文token使用效率。

Comments Accepted at COMSNETS 2026 Graduate Forum. Best Paper Award (Runner Up). 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22426 2026-02-02 cs.HC 50%

ScamPilot: Simulating Conversations with LLMs to Protect Against Online Scams

ScamPilot:利用大语言模型模拟对话以防范网络诈骗

Owen Hoffman, Kangze Peng, Sajid Kamal, Zehua You, Sukrit Venkatagiri

专题命中 Agent评测 :agent(abstract)

AI总结 ScamPilot通过模拟诈骗场景和实时反馈提升用户识别诈骗的能力,有效提高用户防御效果和自信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22346 2026-02-02 cs.GT 50%

FAIRFORMER: A transformer architecture for discrete fair division

FAIRFORMER:一种用于离散公平分配的变压器架构

Chris Mascioli, Satyam Goyal, Mithun Chakraborty

专题命中 Agent评测 :agent(abstract)

AI总结 FAIRFORMER通过双塔变压器架构实现离散公平分配,无需监督训练,能高效分配物品并提升纳什福利。

详情

展开后加载摘要…

URL PDF HTML 收藏