arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-13 至 2026-01-13 共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 5 篇

2202.06191 2026-01-13 cs.GT econ.TH 50%

Exploration and Incentivizing Participation in Randomized Trials

随机试验中的探索与参与激励

Yingkai Li, Aleksandrs Slivkins

专题命中 软件智能体 :agent(abstract)

AI总结 本文研究了随机试验中探索与利用的权衡问题,提出了一种激励相容机制以提高参与度,并分析了不同代理类型的模型变体。

Comments Previous versions focused on clinical RCTs as an application domain, and were titled "Exploration and Incentivizing Participation in Clinical Trials" and "Incentivizing Participation in Clinical Trials" (pre-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2601.07181 2026-01-13 cs.CV 78%

ShowUI-Aloha: Human-Taught GUI Agent

ShowUI-Aloha: 由人类指导的GUI代理

Yichun Zhang, Xiangwu Guo, Yauhong Goh, Jessica Hu, Zhiheng Chen, Xin Wang, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 GUI与网页智能体 :agent(title);autonomous agent(abstract)

AI总结 ShowUI-Aloha通过将无结构的人类屏幕记录转化为结构化任务,提供了一种可扩展的解决方案,用于构建能够从观察人类中有效学习的通用GUI代理。

Comments 13 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06806 2026-01-13 cs.CV cs.AI cs.RO 57%

SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

SpatialNav: 利用空间场景图进行零样本视觉-语言导航

Jiwen Zhang, Zejun Li, Siyuan Wang, Xiangyu Shi, Zhongyu Wei, Qi Wu

机构 * Fudan University, Shanghai, China(复旦大学) University of Southern California, Los Angeles, USA(南加州大学) Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 SpatialNav通过构建空间场景图,利用全局空间表示提升零样本视觉-语言导航的效率与性能。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07715 2026-01-13 eess.SY cs.SY 50%

Safe Navigation under Uncertain Obstacle Dynamics using Control Barrier Functions and Constrained Convex Generators

在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航

Hugo Matias, Daniel Silvestre

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06652 2026-01-13 cs.RO 50%

Follow the Signs: Using Textual Cues and LLMs to Guide Efficient Robot Navigation

跟随标识:利用文本线索和大语言模型引导高效的机器人导航

Jing Cao, Nishanth Kumar, Aidan Curtis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出利用大语言模型和符号模式提升机器人在稀疏环境中高效导航的能力,通过文本线索预测目标位置并优化路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 13 篇

2508.08997 2026-01-13 cs.AI 90%

Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory

内在记忆代理:通过结构化上下文记忆实现异构多代理LLM系统

Sizhe Yuen, Francisco Gomez Medina, Ting Su, Yali Du, Adam J. Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦大学国王学院) University of Southampton(南安普顿大学)

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 本文提出内在记忆代理,通过结构化上下文记忆提升多代理LLM系统在复杂任务中的表现,展现更高的设计质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23010 2026-01-13 cs.SE 89%

TALM: Dynamic Tree-Structured Multi-Agent Framework with Long-Term Memory for Scalable Code Generation

TALM:具有长期记忆的动态树结构多智能体框架用于可扩展的代码生成

Ming-Tung Shen, Yuh-Jzer Joung

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 TALM通过动态树结构多智能体框架结合长期记忆机制,提升复杂代码生成任务中的推理性能和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06282 2026-01-13 cs.CL cs.AI 87%

Amory: Building Coherent Narrative-Driven Agent Memory through Agentic Reasoning

Amory:通过代理推理构建连贯的叙事驱动代理记忆

Yue Zhou, Xiaobo Guo, Belhassen Bayar, Srinivasan H. Sengamedu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Amazon(亚马逊)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(title);分类 cs.AI、cs.CL

AI总结 Amory通过增强代理推理构建连贯的叙事驱动记忆,提升长期对话代理的推理性能与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 81%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12729 2026-01-13 cs.MA cs.IT math.IT 78%

Characterizing Agent-Based Model Dynamics via $ε$-Machines and Kolmogorov-Style Complexity

通过ε机和柯尔莫戈洛夫式复杂性表征基于代理模型的动力学

Roberto Garrone

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 通过ε机和柯尔莫戈洛夫复杂性分析基于代理模型的动力学,揭示预测信息分布及系统层面上的涌现特性。

Comments 33 pages, methodological preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07470 2026-01-13 cs.AI 74%

Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory

学习如何记忆:一种用于结构化和可迁移智能体记忆的元认知管理方法

Sirui Liang, Pengfei Cao, Jian Zhao, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) Department of Gastrointestinal Surgery, Fujian Provincial Cancer Hospital(福建省癌症医院胃肠外科) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 本文提出MCMA方法,通过学习记忆抽象技能提升智能体在长期任务中的记忆管理和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06966 2026-01-13 cs.CL cs.AI 73%

RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction

RealMem: 在真实世界中评估大语言模型的内存驱动交互

Haonan Bian, Zhiyuan Yao, Sen Hu, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen

机构 * Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 RealMem是一个基于真实项目场景的基准,评估大语言模型在长期项目导向交互中的记忆管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07190 2026-01-13 cs.AI 70%

Active Context Compression: Autonomous Memory Management in LLM Agents

主动上下文压缩:LLM代理中的自主内存管理

Nikhil Verma

机构 * Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Focus代理,通过自主压缩上下文提升LLM在长周期任务中的效率与准确性。

Comments 8 pages, 2 figures, 2 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07004 2026-01-13 cs.CR cs.AI 70%

MemTrust: A Zero-Trust Architecture for Unified AI Memory System

MemTrust:面向统一AI内存系统的零信任架构

Xing Zhou, Dmitrii Ustiugov, Haoxin Shang, Kisson Lin

机构 * Independent Researcher(独立研究者) Supermem AI Inc.(Supermem AI公司)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 MemTrust提出了一种五层零信任架构,旨在实现AI内存系统的本地等效安全性和高效协作能力,通过TEE保护和跨应用共享协议提升系统可信度。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06973 2026-01-13 cs.CL 70%

LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents

LLMs无法玩井字游戏:关于语言代理所需私人工作记忆的必要性

Davide Baldelli, Ali Parviz, Amal Zouaq, Sarath Chandar

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔大学) University of California, San Diego(加州大学圣地亚哥分校) LAMA-WeST Lab(LAMA-WeST实验室) Chandar Research Lab(Chandar研究实验室)

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文提出私人状态交互任务(PSITs)并证明标准LLMs无法在交互任务中保持秘密和一致性,提出包含显式私人工作记忆的架构以恢复一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07492 2026-01-13 math.OC stat.ML 67%

Online Markov Decision Processes with Terminal Law Constraints

在线马尔可夫决策过程与终端律约束

Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard, Nadia Oudjane

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 本文提出无重置的周期性框架,旨在通过周期性策略在动态未知的在线场景中实现非渐近保证的最优学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07830 2026-01-13 cs.LG cs.NE q-bio.NC 57%

Optimal Learning Rate Schedule for Balancing Effort and Performance

平衡努力与性能的最佳学习率调度

Valentina Njaradi, Rodrigo Carrasco-Davis, Peter E. Latham, Andrew Saxe

机构 * Gatsby Computational Neuroscience Unit University College London(Gatsby 计算神经科学单元大学学院伦敦) Princeton Neuroscience Institute(普林斯顿神经科学研究所) Sainsbury Wellcome Centre University College London(萨金斯韦尔科中心大学学院伦敦)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种规范性框架,通过最优控制理论推导出最优学习率调度,结合生物合理机制解释学习速度控制与自我调节学习的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07023 2026-01-13 cs.AI 57%

CloneMem: Benchmarking Long-Term Memory for AI Clones

CloneMem:用于AI克隆的长期记忆基准测试

Sen Hu, Zhiyu Zhang, Yuxiang Wei, Xueran Han, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Peking University(北京大学) UC Davis(加州大学戴维斯分校) Georgia Tech(佐治亚理工学院) MBZUAI(穆桑人工智能研究所) HKUST(香港科技大学) UCAS(中国科学技术大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 CloneMem是一个用于评估AI克隆长期记忆能力的基准,通过非对话数字痕迹数据,评估代理对个人状态演变的跟踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 36 篇

2507.05558 2026-01-13 cs.CR cs.AI 88%

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

专题命中 Agent评测 :AI agent(title,abstract);agent(title);agentic(abstract);分类 cs.AI

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE 84%

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 83%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 83%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 82%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03113 2026-01-13 cs.CE 82%

A Probabilistic Digital Twin of UK En Route Airspace for Training and Evaluating AI Agents for Air Traffic Control

基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理

Nick Pepper, Adam Keane, Amy Hodgkin, Dewi Gould, Edward Henderson, Lynge Lauritsen, Christos Vlahos, George De Ath, Richard Everson, Richard Cannon, Alvaro Sierra Castro, John Korna, Ben Carvell, Marc Thomas

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07309 2026-01-13 cs.AI cs.LG 81%

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合

Zhuoka Feng, Kang Chen, Sihan Zhao, Kai Xiong, Yaoning Wang, Minshen Yu, Junjie Nian, Changyi Xiao, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。

Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 81%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07413 2026-01-13 cs.LG cs.MA 79%

The Practicality of Normalizing Flow Test-Time Training in Bayesian Inference for Agent-Based Models

归一化流在基于代理模型的贝叶斯推断中的实用性研究

Junyao Zhang, Jinglai Li, Junqi Tang

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出在基于代理模型的贝叶斯推断中使用测试时间训练归一化流的方法,通过对抗分布偏移提升参数推断的实时调整能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 79%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06112 2026-01-13 cs.AI 79%

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性

Aayush Gupta

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。

Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04288 2026-01-13 cs.HC cs.LG cs.MA 79%

Human-in-the-Loop Testing of AI Agents for Air Traffic Control with a Regulated Assessment Framework

有人参与的AI空中交通管制代理评估框架

Ben Carvell, Marc Thomas, Andrew Pace, Christopher Dorney, George De Ath, Richard Everson, Nick Pepper, Adam Keane, Samuel Tomlinson, Richard Cannon

机构 * NATS University of Exeter(埃克塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于监管认证模拟器的AI空中交通管制代理评估框架,通过人类参与评估提升AI性能测量的真实性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏