arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-19 至 2026-02-19 共收录 77 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 6 篇

2602.06051 2026-02-19 cs.CL 57%

CAST: Character-and-Scene Episodic Memory for Agents

CAST:基于角色和场景的事件记忆用于智能体

Kexin Ma, Bojun Li, Yuhua Tang, Liting Sun, Ruochun Jin

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 CAST通过构建3D场景和角色档案,结合图结构语义记忆,提升智能体对连贯事件的回忆能力,实验结果显示在多个数据集上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17858 2026-02-19 econ.TH 50%

Calibrated Mechanism Design

校准机制设计

Laura Doval, Alex Smolin

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出校准机制设计框架,通过两阶段机制在单代理人场景中实现激励相容性,并证明其在私人价值环境下最优透明性及动态机制的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 13 篇

2602.16037 2026-02-19 cs.AI cs.MA 89%

Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection

自主代理工作流中临床症状检测的优化不稳定性

Cameron Cagan, Pedram Fard, Jiazi Tian, Jingya Cheng, Shawn N. Murphy, Hossein Estiri

机构 * Massachusetts General Hospital(麻省总医院)

专题命中 Agent评测 :autonomous agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究发现自主AI系统在低流行病学任务中,回顾性选择比主动干预更有效,揭示了优化不稳定性导致的失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16429 2026-02-19 cs.CL 83%

TabAgent: A Framework for Replacing Agentic Generative Components with Tabular-Textual Classifiers

TabAgent:一种用表格-文本分类器替代代理生成组件的框架

Ido Levy, Eilam Shapira, Yinon Goldshtein, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research, Haifa, Israel(IBM研究所在以色列海法)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 TabAgent通过表格-文本分类器替代生成决策组件,显著降低代理系统延迟和成本,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04236 2026-02-19 cs.MA cs.AI cs.HC cs.NE 83%

Spore in the Wild: A Case Study of Spore.fun as an Open-Environment Evolution Experiment with Sovereign AI Agents on TEE-Secured Blockchains

野外的孢子:Spore.fun作为主权AI代理在TEE安全区块链上的开放环境进化实验案例研究

Botao Amber Hu, Helena Rong

机构 * Reality Design Lab(现实设计实验室) New York University Shanghai(纽约大学上海)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Spore.fun通过在TEE安全区块链上部署主权AI代理,探索开放环境实现持续开放性进化的可能性。

Comments Accepted by ALIFE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00663 2026-02-19 cs.AI cs.LG q-bio.BM 81%

SEISMO: Increasing Sample Efficiency in Molecular Optimization with a Trajectory-Aware LLM Agent

SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率

Fabian P. Krüger, Andrea Hunklinger, Adrian Wolny, Tim J. Adler, Igor Tetko, Santiago David Villalba

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) TUM School of Computation, Information(TUM计算、信息学院) Technology, Department of Mathematics(技术学院,数学系) Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) Machine Learning Research(机器学习研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。

Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16131 2026-02-19 stat.ML cs.LG 79%

Empirical Cumulative Distribution Function Clustering for LLM-based Agent System Analysis

基于经验累积分布函数的LLM代理系统分析聚类

Chihiro Watanabe, Jingyu Sun

机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 79%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.CL

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03267 2026-02-19 cs.AI cs.CL 73%

GDGB: A Benchmark for Generative Dynamic Text-Attributed Graph Learning

GDGB:生成动态文本属性图学习的基准

Jie Peng, Jiarui Ji, Runlin Lei, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 GDGB提出一个生成动态文本属性图学习的基准,包含高质量数据集和两个新任务,用于评估生成DyTAG的结构、时间和文本质量。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 73%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15891 2026-02-19 cs.RO cs.LG cs.MA 70%

Learning to Drive in New Cities Without Human Demonstrations

在没有人类示范的情况下学习新城市的驾驶

Zilin Wang, Saeed Rahmani, Daphne Cornelisse, Bidipta Sarkar, Alexander David Goldie, Jakob Nicolaus Foerster, Shimon Whiteson

机构 * WhiRL, University of Oxford(WhiRL,牛津大学) FLAIR, University of Oxford(FLAIR,牛津大学) Delft University of Technology(代尔夫特理工大学) NYU Tandon School of Engineering(纽约大学工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 NOMAD通过自play多智能体强化学习,在无需人类示范的情况下,利用地图和元信息实现自动驾驶策略在不同城市间的适应与优化。

Comments Autonomous Driving, Reinforcement Learning, Self-play, Simulation, Transfer Learning, Data-efficient Adaptation. Project Page: https://nomaddrive.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11348 2026-02-19 cs.AI 70%

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试

Ruipeng Wang, Yuxin Chen, Yukai Wang, Chang Wu, Junfeng Fang, Xiaodong Cai, Qi Gu, Hui Su, An Zhang, Xiang Wang, Xunliang Cai, Tat-Seng Chua

机构 * University of Science(科学大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12207 2026-02-19 cs.HC cs.AI cs.SI 57%

VIRENA: Virtual Arena for Research, Education, and Democratic Innovation

VIRENA:虚拟竞技场用于研究、教育和民主创新

Emma Hoes, K. Jonathan Klueser, Fabrizio Gilardi

机构 * University of Zurich(苏黎世大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 VIRENA是一个基于开源技术的无代码平台,用于在现实社交环境中进行受控实验,研究人类与AI的互动、审核干预比较及群体 deliberation。

Comments VIRENA is under active development and currently in use at the University of Zurich. This preprint will be updated as new features are released. For the latest version and to inquire about demos or pilot collaborations, contact the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16286 2026-02-19 quant-ph 50%

What Kind of World Supports Darwinian Evolution? Quantum Foundational Options

什么样的世界支持达尔文进化?量子基础选项

Partha Ghose

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了量子基础选项如何支持达尔文进化,提出通过退相干和随机力学实现经典与量子的连续过渡。

Comments 8 pages, one line diagram

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15784 2026-02-19 cs.GT 50%

Stability in Distance Preservation Games on Graphs

图上距离保持博弈的稳定性

Argyrios Deligkas, Eduard Eiben, Tiger-Lily Goldsmith, Dušan Knop, Šimon Schierreich

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了图上距离保持博弈的稳定性问题,探讨了三种稳定性概念,并分析了问题在拓扑结构、智能体数量和偏好结构等维度上的复杂性。

Comments A preliminary version appeared in AAMAS '26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他Agent 2 篇

2602.16553 2026-02-19 cs.CY 78%

Agentic AI, Medical Morality, and the Transformation of the Patient-Physician Relationship

代理AI、医疗道德与患者-医生关系的变革

Robert Ranisch, Sabine Salloch

专题命中 其他Agent :agentic(title,abstract)

AI总结 本文探讨代理AI如何通过重塑患者-医生关系改变医疗道德,呼吁在广泛应用前融入伦理考量。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16379 2026-02-19 cs.CL 57%

Label-Consistent Data Generation for Aspect-Based Sentiment Analysis Using LLM Agents

基于 LLM 代理的标签一致数据生成用于基于方面的情感分析

Mohammad H. A. Monfared, Lucie Flek, Akbar Karimi

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-阿赫恩国际信息科技中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 本文提出了一种基于 LLM 代理的数据增强方法,通过迭代生成和验证提升 ABSA 中标签一致性的效果,尤其在方面术语生成任务中表现更优。

Comments Accepted to WASSA Workshop at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏