arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2602.16131 2026-02-19 stat.ML cs.LG 79%

Empirical Cumulative Distribution Function Clustering for LLM-based Agent System Analysis

基于经验累积分布函数的LLM代理系统分析聚类

Chihiro Watanabe, Jingyu Sun

机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 79%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.CL

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11661 2026-02-18 cs.AI 79%

SR-Scientist: Scientific Equation Discovery With Agentic AI

SR-Scientist:基于代理AI的科学方程发现

Shijie Xia, Yuhan Sun, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) GAIR

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 SR-Scientist通过代理AI实现科学方程发现,具备自主编写代码、分析数据、优化方程的能力,实验表明其在多个科学领域表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14970 2026-02-17 cs.CL 79%

Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance System

基于大语言模型的客服代理质量保障系统的反事实公平性评估

Kawin Mayilvaghanan, Siddhant Gupta, Ayush Kumar

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的客服代理质量保障系统在公平性方面的表现,发现系统性偏见问题,指出需标准化的公平性审计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12315 2026-02-16 cs.IR cs.AI 79%

AgenticShop: Benchmarking Agentic Product Curation for Personalized Web Shopping

AgenticShop: 评估面向个性化网络购物的智能代理产品整理

Sunghwan Kim, Ryang Heo, Yongsik Seo, Jinyoung Yeo, Dongha Lee

机构 * Department of Artificial Intelligence Yonsei University Seoul Republic of Korea(人工智能系 首尔国立庆尚大学 首尔 大韩民国) ParamitaAI Seoul Republic of Korea(ParamitaAI 首尔 大韩民国) Yonsei University(首尔国立庆尚大学) ParamitaAI

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 AgenticShop是首个评估智能代理系统在开放网络环境中进行个性化产品整理的基准测试,通过真实购物场景和多样用户资料,验证代理系统在复杂购物情境中的适应能力。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02388 2026-02-13 cs.CL 79%

Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation

学习路由:一种基于规则的代理框架用于混合源检索增强生成

Haoyue Bai, Haoyu Wang, Shengyu Chen, Zhengzhang Chen, Lu-An Tang, Wei Cheng, Haifeng Chen, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) NEC Laboratories America(NEC美国实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出基于规则的路由框架,通过系统规则选择合适来源提升检索增强生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09063 2026-02-11 q-bio.GN cs.AI 79%

scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis

scBench:在单细胞RNA测序分析中评估AI代理

Kenny Workman, Zhen Yang, Harihara Muralidharan, Aidan Abdulali, Hannah Le

机构 * LatchBio

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 scBench通过394个可验证问题评估AI代理在单细胞RNA测序分析中的性能,揭示模型与平台选择对准确率的影响,为开发可靠分析工具提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18226 2026-02-09 cs.AI 79%

Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks

yunjue代理技术报告:一种完全可重现、零起点现场自我进化代理系统用于开放性任务

Haotian Li, Shijun Yang, Weizhen Qi, Silei Zhao, Rui Hua, Mingzhu Song, Xiaojian Yang, Chao Peng

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Yunjue代理系统通过现场自我进化范式实现零起点环境下开放性任务的可重现、自适应能力扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 79%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15784 2026-02-04 q-bio.NC cs.LG 79%

Emergent time-keeping mechanisms in a deep reinforcement learning agent performing an interval timing task

深度强化学习代理在区间定时任务中涌现的时间保持机制

Amrapali Pednekar, Alvaro Garrido, Pieter Simoens, Yara Khaluf

机构 * IDLab, Department of Information Technology, Ghent University - imec(IDLab信息科技系,根特大学-imec) Department of Social Sciences, Wageningen University and Research(社会科学系,瓦赫宁根大学与研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究通过深度强化学习代理在区间定时任务中的表现,揭示了类似生物节律的时间保持机制,并探讨了其与生物模型的类比。

Comments Accepted at 2025 Artificial Life Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02345 2026-02-03 cs.SE 79%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00352 2026-02-03 cs.CL 79%

DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning

DETOUR:双智能体搜索与推理的交互基准

Li Siyan, Darshan Deshpande, Anand Kannappan, Rebecca Qian

机构 * Patronus AI DAP Lab(DAP实验室) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22964 2026-02-02 cs.AI 79%

EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning

EvoClinician: 一种通过测试时进化学习进行多轮医学诊断的自进化代理

Yufei He, Juncheng Liu, Zhiyuan Hu, Yulin Chen, Yue Liu, Yuan Sui, Yibo Li, Nuo Chen, Jun Hu, Bryan Hooi, Xinxing Xu, Jiang Bian

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EvoClinician通过测试时进化学习实现多轮医学诊断,采用'诊断-评分-进化'循环提升诊断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22290 2026-02-02 cs.AI 79%

The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

六西格玛代理:通过共识驱动的分解执行实现企业级可靠性

Khush Patel, Siva Surendira, Jithin George, Shreyas Kapale

机构 * Lyzr Research(Lyzr研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 六西格玛代理通过共识驱动的分解执行实现企业级可靠性,显著提升AI系统可靠性并降低成本。

Comments 25 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 79%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 79%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 Agent评测 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 79%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 79%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15034 2026-01-22 cs.HC cs.AI 79%

Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent

基于大型语言模型的车载对话代理的视觉与认知需求

Chris Monk, Allegra Ayala, Christine S. P. Yu, Gregory M. Fitch, Dara Gruber

机构 * Exponent, Inc.(Exponent公司) Google, Inc.(Google公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究评估了基于大型语言模型的车载对话代理在驾驶中的视觉与认知需求,发现其与免提通话在认知负荷上相当,且视觉需求较低,支持其在驾驶环境中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 79%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10809 2026-01-19 cs.CL 79%

A Concise Agent is Less Expert: Revealing Side Effects of Using Style Features on Conversational Agents

简洁的代理不如专家:使用风格特征于对话代理时揭示副作用

Young-Min Cho, Yuan Yuan, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 研究揭示了在对话代理中使用风格特征时的副作用,指出不同风格特征之间存在深度交织,传统方法难以有效控制,需更原理化的多目标引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11485 2026-01-19 cs.CL 79%

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

错误笔记本学习:用于无训练代理适应的批量聚类失败

Xuanbo Su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang

机构 * Bairong Inc.(柏龙公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Software, Jilin University(吉林大学软件学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15143 2026-01-16 cs.AI cs.MA 79%

An intelligent agent-based simulation of human mobility in extreme urban morphologies

基于智能代理的极端城市形态中人类移动性模拟

Abderaouf Bahi, Amel Ourici

机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09688 2026-01-15 cs.CL 79%

DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation

DeepResearchEval: 一种用于深度研究任务构建和代理评估的自动化框架

Yibo Wang, Lei Wang, Yue Deng, Keming Wu, Yao Xiao, Huanjin Yao, Liwei Kang, Hai Ye, Yongcheng Jing, Lidong Bing

机构 * Infinity Lab, Shanda Group(沙达集团无限实验室) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DeepResearchEval提出了一种自动化框架,通过基于角色的任务生成流程和自适应评估机制,解决深度研究任务构建和评估中的挑战。

Comments Source code: https://github.com/Infinity-AILab/DeepResearchEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 79%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 79%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 79%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07413 2026-01-13 cs.LG cs.MA 79%

The Practicality of Normalizing Flow Test-Time Training in Bayesian Inference for Agent-Based Models

归一化流在基于代理模型的贝叶斯推断中的实用性研究

Junyao Zhang, Jinglai Li, Junqi Tang

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出在基于代理模型的贝叶斯推断中使用测试时间训练归一化流的方法,通过对抗分布偏移提升参数推断的实时调整能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 79%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏