arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-11-25 至 2025-11-25 共收录 33 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 33 篇

2508.01285 2025-11-25 cs.AI cs.IR stat.AP 88%

BioDisco: Multi-agent hypothesis generation with dual-mode evidence, iterative feedback and temporal evaluation

BioDisco:基于双模式证据、迭代反馈和时间评估的多智能体假设生成

Yujing Ke, Kevin George, Kathan Pandya, David Blumenthal, Maximilian Sprang, Gerrit Großmann, Sebastian Vollmer, David Antony Selby

机构 * Data Science and its Applications, DFKI(数据科学及其应用,德系人工智能研究所) DFKI Friedrich-Alexander-Universität Erlangen-Nürnberg(德系人工智能研究所,弗赖堡-埃朗根-纽伦堡大学) University of Saarland(萨尔大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-埃朗根-纽伦堡大学) University of Kaiserslautern–Landau (RPTU)(凯撒斯劳滕-兰道大学(RPTU)) Department of Dermatology, University Medical Center Mainz(梅奥医学中心法兰克福大学皮肤科)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 BioDisco通过双模式证据系统、迭代反馈和时间评估,实现多智能体生成新颖且证据支持的科学假设。

Comments 12 pages main content, 31 including appendices. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19262 2025-11-25 cs.AI cs.LG math.ST stat.TH 84%

Psychometric Tests for AI Agents and Their Moduli Space

人工智能代理的心理测量测试及其模空间

Przemyslaw Chojecki

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于模理论的视角,用于分析人工智能代理的心理测量测试电池,并定义了AAI分数及其核心概念,揭示了测试电池在对称性下的不变性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 83%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24591 2025-11-25 cs.CL astro-ph.IM 83%

ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?

ReplicationBench: 人工智能代理能否复制天体物理学研究论文?

Christine Ye, Sihan Yuan, Suchetha Cooray, Steven Dillmann, Ian L. V. Roque, Dalya Baron, Philipp Frank, Sergio Martin-Alvarez, Nolan Koblischke, Frank J Qu, Diyi Yang, Risa Wechsler, Ioana Ciuca

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 ReplicationBench旨在评估人工智能代理复制天体物理学研究论文的能力,通过测试代理在实验设置、推导、数据分析和代码库等任务上的表现,揭示代理在科学研究中的可靠性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 83%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17580 2025-11-25 cs.MA cs.AI cs.DC cs.SE 82%

A novel strategy for multi-resource load balancing in agent-based systems

基于智能体系统的多资源负载平衡新策略

Leszek Sliwko, Aleksander Zgrzywa

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于智能体系统的多资源负载平衡策略,通过智能体的社会行为和适应能力优化复杂企业架构的结构。

Journal ref "A novel strategy for multi-resource load balancing in agent-based systems." International journal of intelligent information and database systems (Print) 3, no. 2 (2009): 180-202

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 81%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02744 2025-11-25 cs.AI 79%

Large Language Model-based Data Science Agent: A Survey

基于大型语言模型的数据科学代理:综述

Ke Chen, Peiran Wang, Yaoning Yu, Xianyang Zhan, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文综述了基于LLM的数据科学代理,从代理设计和数据科学流程两个角度探讨其关键原则与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09938 2025-11-25 cs.HC 78%

Design and Evaluation of Generative Agent-based Platform for Human-Assistant Interaction Research: A Tale of 10 User Studies

生成性代理平台的设计与评估:人类-助手交互研究的叙述:10项用户研究

Ziyi Xuan, Yiwen Wu, Xuhai Xu, Vinod Namboodiri, Mooi Choo Chuah, Yu Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种生成性代理模拟平台,用于研究人类-助手交互,通过模拟十项现有研究验证了其有效性,为高效研究助手代理设计提供了新方法。

Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9, 4, Article 229 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18352 2025-11-25 cs.CV 78%

MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference

MagicWand: 一个通用代理用于生成与评估,与用户偏好对齐

Zitong Xu, Dake Shen, Yaosong Du, Kexiang Hao, Jinghan Huang, Xiande Huang

机构 * Shanghai Jiao Tong University(上海交通大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen China(香港中文大学(深圳))

专题命中 Agent评测 :agent(title,abstract)

AI总结 MagicWand通过结合用户偏好数据集和先进生成模型,实现高质量内容生成与偏好对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18155 2025-11-25 cs.CR cs.OS 78%

eBPF-PATROL: Protective Agent for Threat Recognition and Overreach Limitation using eBPF in Containerized and Virtualized Environments

eBPF-PATROL:基于eBPF的容器化和虚拟化环境中的威胁识别与越界限制保护代理

Sangam Ghimire, Nirjal Bhurtel, Roshan Sahani, Sudan Jha

专题命中 Agent评测 :agent(title,abstract)

AI总结 eBPF-PATROL通过eBPF技术在容器化和虚拟化环境中实现低开销的实时安全防护,有效检测和防止威胁行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17875 2025-11-25 math.OC 78%

Modeling and Calibration of Supplier Selection Problem in Freight Agent-Based Simulations

货运 agent 仿真实验中供应商选择问题的建模与校准

Abdelrahman Ismael, Taner Cokyasar

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究提出了一种大规模校准的 agent 仿真实验模型,用于建模和校准供应商选择问题,以提高货运网络流的预测精度和供应链的韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13223 2025-11-25 cs.AI cs.SY eess.SY math.OC 77%

Distributionally Robust Free Energy Principle for Decision-Making

面向决策的分布鲁棒自由能原理

Allahkaram Shafiei, Hozefa Jesawada, Karl Friston, Giovanni Russo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出分布鲁棒自由能模型,通过设计增强代理的鲁棒性,使其在训练与环境不一致时仍能完成任务。

Comments Contains main text and supplementary information. Supplementary movie is at the paper repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19334 2025-11-25 cs.CY 75%

Normative active inference: A numerical proof of principle for a computational and economic legal analytic approach to AI governance

规范性主动推断:一种计算和经济法律分析方法用于AI治理的数值原理证明

Axel Constant, Mahault Albarracin, Karl J. Friston

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出通过设计监管实现合法且规范敏感的AI行为,利用主动推断框架模拟自动驾驶场景,展示法律规范对AI代理决策的影响。

Comments 19 pages, 6 figures, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18036 2025-11-25 cs.AI cs.CL cs.IR 73%

Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers

Paper2SysArch: 从科学论文生成结构约束的系统架构图

Ziyi Guo, Zhou Liu, Wentao Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Paper2SysArch通过多智能体协作从科学论文生成结构化的系统架构图,建立首个大规模基准以推动自动化科学可视化的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18298 2025-11-25 cs.AI 70%

Cross-Disciplinary Knowledge Retrieval and Synthesis: A Compound AI Architecture for Scientific Discovery

跨学科知识检索与综合:一种用于科学发现的复合AI架构

Svitlana Volkova, Peter Bautista, Avinash Hiriyanna, Gabriel Ganberg, Isabel Erickson, Zachary Klinefelter, Nick Abele, Hsien-Te Kao, Grant Engberson

机构 * Aptima, Inc.(Aptima公司)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 BioSage通过整合LLMs与RAG,利用专门代理实现跨学科知识检索与综合,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 70%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19109 2025-11-25 cs.CV 67%

HABIT: Human Action Benchmark for Interactive Traffic in CARLA

HABIT: 交互交通中的人类行为基准

Mohan Ramesh, Mark Azer, Fabian B. Flohr

机构 * Intelligent Vehicles Lab, Munich University of Applied Sciences(智能车辆实验室,慕尼黑应用科学大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 HABIT是一个高保真度的交互交通人类行为基准,通过整合现实人类运动数据提升自动驾驶模拟的真实性,揭示现有自动驾驶代理在复杂场景下的性能缺陷。

Comments Accepted to WACV 2026. This is the pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18700 2025-11-25 cs.MM 67%

When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation

当顶级推荐失效时:建模多粒度负面反馈以实现可解释且稳健的视频推荐

Siran Chen, Boyu Chen, Chenyun Yu, Yi Ouyang, Cheng Lei, Chengxiang Zhuo, Zang Li, Yali Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出ENF框架和S-GRPO算法,通过多粒度负面反馈建模提升视频推荐的可解释性和鲁棒性,实验表明在负面反馈预测和用户满意度提升方面效果显著。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00392 2025-11-25 cs.CV 67%

RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes

RefDrone:一种针对无人机场景中指称表达理解的挑战性基准

Zhichao Sun, Yepeng Liu, Zhiling Su, Huachao Zhu, Yuliang Gu, Yuda Zou, Zelong Liu, Gui-Song Xia, Bo Du, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 RefDrone提出了一种针对无人机场景中指称表达理解的挑战性基准,通过RDAgent和NGDINO方法提升了多目标和无目标情况下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19107 2025-11-25 cs.LG cs.AI cs.GT stat.ML 62%

The Core in Max-Loss Non-Centroid Clustering Can Be Empty

最大损失非质心聚类中的核心可能为空

Robert Bredereck, Eva Deltl, Leon Kellerhals, Jannik Peters

机构 * TU Clausthal(图鲁斯大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究证明在最大损失目标下非质心聚类中核心可能为空,并给出了相关理论界和构造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 62%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07777 2025-11-25 cs.CL cs.AI 62%

Drift No More? Context Equilibria in Multi-Turn LLM Interactions

多轮交互中不再漂移:多轮LLM交互中的上下文均衡

Vardhan Dongre, Ryan A. Rossi, Viet Dac Lai, David Seunghyun Yoon, Dilek Hakkani-Tür, Trung Bui

机构 * Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出了一种动态框架,通过KL散度和递归模型解释多轮交互中的上下文漂移,展示可控干预能有效减少漂移,表明漂移是可控均衡现象而非必然衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 57%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18728 2025-11-25 cs.LG 57%

Reinforcement Learning for Self-Healing Material Systems

强化学习用于自修复材料系统

Maitreyi Chatterjee, Devansh Agarwal, Biplab Chatterjee

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究通过强化学习方法实现材料自修复,展示了TD3智能体在动态环境下更高效的自修复能力。

Comments Accepted to INCOM 2026. This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03480 2025-11-25 cs.SE 57%

LLM Agents for Automated Dependency Upgrades

基于大语言模型的自动化依赖升级代理

Vali Tawosi, Salwa Alamir, Xiaomo Liu, Manuela Veloso

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出基于LLM代理的自动化依赖升级方法,通过合成数据验证,实现了高效准确的代码更新与兼容性保障。

Comments Accepted to AISM Workshop at ASE 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17953 2025-11-25 cs.LG stat.ML 57%

On Transportability for Structural Causal Bandits

关于结构因果投递的强化学习

Min Woo Park, Sanghack Lee

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种结构因果投递框架,通过融合源环境的先验信息来增强部署学习,实现了亚线性遗憾界并可能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06929 2025-11-25 cs.AI 57%

Making a prototype of Seoul historical sites chatbot using Langchain

利用Langchain制作首尔历史遗址聊天机器人原型

Jae Young Suh, Minsoo Kwak, Soo Yong Kim, Hyoungseo Cho

机构 * Hanyang(翰阳大学) Konkuk(konkuk大学) Seoul National(首尔国立大学) Myongji University(明gies大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用Langchain开发首尔历史遗址聊天机器人原型,旨在通过提供准确信息提升游客对当地文化遗产的认知。

Comments 4 pages, 4 figures, draft

Journal ref Journal of Electrical Electronics Engineering, 3(1), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19346 2025-11-25 cs.GT math.DS math.SP 50%

Disc Game Dynamics: A Latent Space Perspective on Selection and Learning in Games

博弈动力学:从潜在空间视角看博弈中的选择与学习

Pablo Lechon-Alonso, Andrew Dennehy, Ruizheng Bai, Nicolas Sanchez, Derek K. Wise, David Sewell, David Rosenbluth, Alexander Strang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出圆盘博弈嵌入方法,通过潜在空间分析对称零和博弈中的选择与学习过程,揭示了进化过程在该空间中的简化形式及精确等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18548 2025-11-25 cs.HC 50%

Emotion-Aware Conversational Recommender Systems: a Case Study

具有情感意识的对话推荐系统:一个案例研究

Maria Stella Albarelli

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出了一种具有情感意识的对话推荐系统,通过分析用户情绪提升在线购物体验,采用基于内容的推荐方法,结合自然语言处理实现个性化建议。

详情

展开后加载摘要…

URL PDF HTML 收藏