arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2506.23046 2025-12-16 cs.CL cs.AI cs.CV cs.RO 73%

SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions

SoMi-ToM:评估具身社会互动中的多视角理论之心假设

Xianzhe Fan, Xuhui Zhou, Chuanyang Jin, Kolby Nottingham, Hao Zhu, Maarten Sap

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。

Comments 24 pages, 6 figures

Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 73%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07785 2025-12-10 physics.data-an cs.AI cs.LG hep-ex 73%

Automating High Energy Physics Data Analysis with LLM-Powered Agents

利用LLM代理自动化高能物理数据分析

Eli Gendreau-Distler, Joshua Ho, Dongwon Kim, Luc Tomas Le Pottier, Haichen Wang, Chengxi Yang

机构 * Department of Physics, University of California, Berkeley, Berkeley, CA 94720, USA(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(伯克利国家实验室物理部)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM代理自动化高能物理数据分析,通过混合系统结合LLM和Snakemake工作流管理器,评估代理在多阶段工作流中的性能。

Comments 16 pages, 6 figures, 2 tables, the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) - Machine Learning and the Physical Sciences (ML4PS) workshop (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 73%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17467 2025-12-03 cs.LG cs.AI 73%

PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM

具有图RAG的PersonaAgent:面向个性化LLM的社区感知知识图谱

Siqi Liang, Yudi Zhang, Yue Guo

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 PersonaAgent结合图RAG技术,通过构建社区感知的知识图谱,提升个性化LLM在新闻分类、电影标签和产品评分任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07663 2025-12-02 cs.AI cs.CL cs.CY cs.HC 73%

Human Decision-making is Susceptible to AI-driven Manipulation

人类决策易受AI驱动的操控

Sahand Sabour, June M. Liu, Siyang Liu, Chris Z. Yao, Shiyao Cui, Xuanming Zhang, Wen Zhang, Yaru Cao, Advait Bhat, Jian Guan, Wei Wu, Rada Mihalcea, Hongning Wang, Tim Althoff, Tatia M. C. Lee, Minlie Huang

机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ANT Group(ANT集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 73%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA 73%

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19489 2025-11-26 cs.SE cs.AI 73%

Evolution without an Oracle: Driving Effective Evolution with LLM Judges

无Oracle的进化:通过LLM裁判驱动有效进化

Zhe Zhao, Yuheng Yang, Haibin Wen, Xiaojie Qiu, Zaixi Zhang, Qingfu Zhang

机构 * Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MADE框架,通过问题规范减少LLM反馈噪声,实现无Oracle的进化优化,在软件需求满足和复杂指令跟随任务中取得显著成效。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18036 2025-11-25 cs.AI cs.CL cs.IR 73%

Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers

Paper2SysArch: 从科学论文生成结构约束的系统架构图

Ziyi Guo, Zhou Liu, Wentao Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Paper2SysArch通过多智能体协作从科学论文生成结构化的系统架构图,建立首个大规模基准以推动自动化科学可视化的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 73%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15370 2025-11-20 cs.CL cs.AI 73%

The Empowerment of Science of Science by Large Language Models: New Tools and Methods

Guoqiang Liang, Jingqian Gong, Mengxuan Li, Gege Lin, Shuo Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

Comments The manuscript is currently ongoing the underreview process of the journal of information science

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11654 2025-11-19 cs.IR cs.AI cs.CL 73%

FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection

Daniel Berhane Araya, Duoduo Liao

机构 * College of Engineering and Computing(工程与计算学院) George Mason University(乔治·马歇尔大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11576 2025-11-18 cs.LG cs.AI 73%

DAOpt: Modeling and Evaluation of Data-Driven Optimization under Uncertainty with LLMs

WenZhuo Zhu, Zheng Cui, Wenhan Lu, Sheng Liu, Yue Zhao

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07871 2025-11-10 cs.RO cs.AI cs.CV cs.LG 73%

Learning to Navigate Socially Through Proactive Risk Perception

Erjia Xiao, Lingfeng Zhang, Yingbo Tang, Hao Cheng, Renjing Xu, Wenbo Ding, Lei Zhou, Long Chen, Hangjun Ye, Xiaoshuai Hao

机构 * HKUST (GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Institute of Automation, CAS(中国科学院自动化研究所) Xiaomi EV(小米电动车)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03757 2025-11-07 cs.LG cs.AI 73%

Laugh, Relate, Engage: Stylized Comment Generation for Short Videos

Xuan Ouyang, Senan Wang, Bouzhou Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22751 2025-11-05 stat.ML cs.AI cs.LG 73%

Variance-Bounded Evaluation of Entity-Centric AI Systems Without Ground Truth: Theory and Measurement

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04365 2025-11-05 cs.LG cs.AI cs.PL 73%

AutoPDL: Automatic Prompt Optimization for LLM Agents

Claudio Spiess, Mandana Vaziri, Louis Mandel, Martin Hirzel

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments An earlier version of this paper was published in AutoML 2025 Methods Track. This version adds missing standard deviations in Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01166 2025-11-04 cs.CL cs.SE 73%

MicroRemed: Benchmarking LLMs in Microservices Remediation

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Chiming Duan, Minghua He, Leyi Pan, Zhaoyang Liu, Bolin Ding, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.SE

Comments 24 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00039 2025-11-04 cs.AI cs.LG 73%

Graph-Attentive MAPPO for Dynamic Retail Pricing

Krishna Kumar Neelakanta Pillai Santha Kumari Amma

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27238 2025-11-03 cs.DB cs.AI cs.CL cs.IR 73%

DRAMA: Unifying Data Retrieval and Analysis for Open-Domain Analytic Queries

Chuxuan Hu, Maxwell Yang, James Weiland, Yeji Lim, Suhas Palawala, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21031 2025-10-27 cs.SE cs.AI 73%

AgentArcEval: An Architecture Evaluation Method for Foundation Model based Agents

Qinghua Lu, Dehai Zhao, Yue Liu, Hao Zhang, Liming Zhu, Xiwei Xu, Angela Shi, Tristan Tan, Rick Kazman

机构 * Data61, CSIRO, Australia(Data61,CSIRO,澳大利亚) Empathetic AI, Australia(Empathetic AI,澳大利亚) University of Hawaii, Honolulu, HI, USA(夏威夷大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10213 2025-10-21 cs.SE cs.AI 73%

An Empirical Study on LLM-based Agents for Automated Bug Fixing

Xiangxin Meng, Zexiong Ma, Pengfei Gao, Chao Peng

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15996 2025-10-21 cs.LG cs.AI 73%

Using Kolmogorov-Smirnov Distance for Measuring Distribution Shift in Machine Learning

Ozan K. Tonguz, Federico Taschin

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国) KTH Royal Institute of Technology, Sweden(皇家理工学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14677 2025-10-17 cs.RO cs.AI cs.LG cs.MA 73%

When Planners Meet Reality: How Learned, Reactive Traffic Agents Shift nuPlan Benchmarks

Steffen Hagedorn, Luka Donkov, Aron Distelzweig, Alexandru P. Condurache

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Institute for Neuro- and Bioinformatics, University of Lübeck(神经与生物医学研究所,吕贝克大学) Engineering Faculty, DHBW Stuttgart(工程学院,斯图加特DHBW) Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 73%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08429 2025-10-10 cs.LG cs.AI stat.ML 73%

ClauseLens: Clause-Grounded, CVaR-Constrained Reinforcement Learning for Trustworthy Reinsurance Pricing

Stella C. Dong, James R. Finlay

机构 * Department of Applied Mathematics, University of California, Davis, CA, USA(加州大学戴维斯分校应用数学系) Wharton School of Business, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学沃顿商学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication at the 6th ACM International Conference on AI in Finance (ICAIF 2025), Singapore. Author-accepted version (October 2025). 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07740 2025-10-10 cs.SE cs.AI 73%

AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?

Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU)) School of Computer Science, Peking University, China(北京大学计算机科学学院) Columbia University, USA(哥伦比亚大学) Beijing Jiaotong University, China(北京交通大学) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所) Simon Fraser University, Canada(西蒙弗雷泽大学) Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments Under Review. Benchmark and leadboards at https://appforge-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05096 2025-10-10 cs.CV cs.AI cs.CL cs.MA cs.MM 73%

Paper2Video: Automatic Video Generation from Scientific Papers

Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Project Page: https://showlab.github.io/Paper2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03696 2025-10-07 cs.AI cs.CL 73%

Mind the Goal: Data-Efficient Goal-Oriented Evaluation of Conversational Agents and Chatbots using Teacher Models

Deepak Babu Piskala, Sharlene Chen, Udita Patel, Parul Kalra, Rafael Castrillo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏