arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-03 至 2026-02-03 共收录 247 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 14 篇

2511.01817 2026-02-03 cs.CV 50%

SciTextures: Collecting and Connecting Visual Patterns, Models, and Code Across Science and Art

SciTextures: 收集和连接科学与艺术中的视觉模式、模型和代码

Sagi Eppel, Alona Strugatski

专题命中 软件智能体 :agentic(abstract)

AI总结 SciTextures通过连接视觉模式与生成机制,提供大规模数据集评估VLMs对物理系统多层抽象的理解与模拟能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12054 2026-02-03 cs.GT 50%

Contracting with a Mechanism Designer

机制设计中的合同签订

Tian Bai, Yiding Feng, Yaohao Liu, Mengfan Ma, Mingyu Xiao

专题命中 软件智能体 :agent(abstract)

AI总结 本文研究了众包市场中主体通过中介与工人互动的机制设计问题,提出了虚拟价值定价模型,并分析了双边际化价格和纳什均衡价格在不同分布下的界限。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 7 篇

2602.02468 2026-02-03 cs.AI cs.CL 73%

Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts

Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合

Aiden Yiliu Li, Xinyue Hao, Shilong Liu, Mengdi Wang

机构 * University College London(伦敦大学学院) The University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11891 2026-02-03 cs.CL cs.AI 73%

Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents

Mobile-Bench-v2: 一种更现实和全面的基于VLM的移动代理基准测试

Weikai Xu, Zhizheng Jiang, Yuxuan Liu, Pengzhi Gao, Wei Liu, Jian Luan, Yuanchun Li, Yunxin Liu, Bin Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) MiLM Plus, Xiaomi Inc.(小米公司 MiLM Plus) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究所)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Mobile-Bench-v2通过引入基于槽位的指令生成方法,构建了一个更现实和全面的基准测试,以评估基于VLM的移动代理在处理噪声、多路径任务和主动交互方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02158 2026-02-03 cs.AI 57%

Traffic-Aware Navigation in Road Networks

道路网络中的交通感知导航

Sarah Nassar

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Queen’s University(女王大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本研究比较了三种图搜索方法在Kingston道路网络中交通感知导航中的性能,发现Dijkstra和A*在交通感知最优解方面表现最佳,而Yen's算法在预处理和运行效率上取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19199 2026-02-03 cs.AI 57%

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理

Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01290 2026-02-03 cs.NI 50%

AOASS: Adaptive Obstacle-Aware Square Spiral Framework for Single-mobile Anchor-Based WSN Localization

AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位

Abdelhady Naguib

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01266 2026-02-03 cs.RO 50%

Reinforcement Learning for Active Perception in Autonomous Navigation

自主导航中的主动感知强化学习

Grzegorz Malczyk, Mihir Kulkarni, Kostas Alexis

机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 系,挪威科学技术大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种端到端强化学习框架,使无人机在复杂环境中通过主动控制相机实现安全导航与探索。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11250 2026-02-03 cs.CR cs.CV 50%

Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments

针对现实动态环境中的GUI代理的环境注入攻击

Yitong Zhang, Ximo Li, Liyi Cai, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 12 篇

2507.18992 2026-02-03 cs.LG cs.AI 81%

Reinforcement Learning via Conservative Agent for Environments with Random Delays

通过保守代理进行具有随机延迟的环境强化学习

Jongsoo Lee, Jangwon Kim, Jiseok Jeong, Soohee Han

机构 * Department of Convergence IT Engineering, Pohang University of Science and Technology(融合信息技术工程系,POSTECH) Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出保守代理,通过将随机延迟环境转换为等效恒定延迟环境,提升连续控制任务中的渐近性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01305 2026-02-03 cs.CV 78%

StoryState: Agent-Based State Control for Consistent and Editable Storybooks

StoryState: 基于代理的状态控制用于一致且可编辑的故事书

Ayushman Sarkar, Zhenyu Yu, Wei Tang, Chu Chen, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02369 2026-02-03 cs.AI cs.LG 76%

Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback

Live-Evo: 从连续反馈中在线进化智能记忆

Yaolun Zhang, Yiran Wu, Yijiong Yu, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) AG2 AI(AG2人工智能) Penn State University(宾夕法尼亚州立大学)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI、cs.LG

AI总结 Live-Evo通过在线进化记忆系统,在连续反馈中提升任务性能和市场收益。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 75%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01154 2026-02-03 cs.AI cs.GT cs.MA 70%

Past-Discounting is Key for Learning Markovian Fairness with Long Horizons

过去折扣是学习具有长时间范围的马尔可夫公平性的关键

Ashwin Kumar, William Yeoh

机构 * Washington University in St Louis(华盛顿大学圣路易斯分校)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出了一种结合过去折扣的公平性框架,解决了长期时间范围内学习马尔可夫公平性的关键挑战,通过理论分析证明其在状态空间的有界性,为可扩展的公平资源分配提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02260 2026-02-03 cs.LG 57%

Learning Markov Decision Processes under Fully Bandit Feedback

在完全老虎机反馈下学习马尔可夫决策过程

Zhengjia Zhuo, Anupam Gupta, Viswanath Nagarajan

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运作工程系,密歇根大学) Computer Science Department, New York University(计算机科学系,纽约大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出了在完全老虎机反馈下学习回合制MDP的高效算法,实现了O(√T)的后悔界,并展示了其在k-项预言不等式中的性能与有详细反馈的算法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01966 2026-02-03 cs.LG 57%

Self-Consolidation for Self-Evolving Agents

自组织式自进化代理

Hongzhuo Yu, Fei Zhu, Guo-Sen Xie, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,中国科学院香港研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种自组织式自进化框架,通过对比反思和自组织机制,使LLM代理能有效利用历史经验实现长期进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01558 2026-02-03 cs.LG 57%

How Implicit Bias Accumulates and Propagates in LLM Long-term Memory

隐性偏见如何在LLM长期记忆中积累和传播

Yiming Ma, Lixu Wang, Lionel Z. Wang, Hongkun Yang, Haoming Sun, Xin Xu, Jiaqi Wu, Bin Chen, Wei Dong

机构 * International Research Center for Artificial Intelligence, Harbin Institute of Technology (Shenzhen), Shenzhen, China Chongqing Research Institute of Harbin Institute of Technology, Chongqing, China College of Computing Data Science, Nanyang Technological University, Singapore Department of Management Marketing, The Hong Kong Polytechnic University, Hong Kong Haide College, Ocean University of China, Qingdao, China School of Computer Science, The University of Sheffield, Sheffield, UK Department of Automation, Tsinghua University, Beijing, China

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 本文研究了LLM长期记忆中隐性偏见的积累与传播,提出动态内存标记方法以缓解偏见问题。

Comments Under review, and the first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17098 2026-02-03 cs.CR cs.AI 57%

Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models

Transformer记忆能否被破坏?调查大型语言模型中的缓存侧漏洞

Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电子与计算机工程系)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本文提出恶意令牌注入框架,揭示了大型语言模型缓存中的安全漏洞,通过扰动缓存关键向量影响模型输出和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00787 2026-02-03 cs.ET 50%

Hybrid Artificial-Living Cell Collectives for Wetware Computing

混合人工-生物细胞集体用于湿ware计算

Ceylin Savas, Maryam Javed, Murat Kuscu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种混合人工-生物细胞网络,通过人工细胞调控生化环境并利用细菌集体实现非线性时空动态,用于时间序列预测任务,展示了其在生物医学应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00551 2026-02-03 cs.RO cs.CV 50%

APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation

APEX:一种解耦的记忆型探索者用于异步空中目标导航

Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学) Central South University(中南大学) Meituan Academy of Robotics(美团机器人研究院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 APEX通过分层异步架构实现高效空中目标导航,提升探索效率与目标识别精度。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09058 2026-02-03 cs.RO cs.SY eess.SY 50%

Reach-Avoid-Stabilize Using Admissible Control Sets

利用可接受控制集实现到达-回避-稳定

Zheng Gong, Boyang Li, Sylvia Herbert

机构 * Mechanical and Aerospace Engineering at UC San Diego(机械与航空航天工程系,UC圣地亚哥大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出利用可接受控制集的方法,解决可达-回避-稳定问题,确保系统在连续目标和障碍物回避下安全稳定到达感兴趣点。

Comments 7 pages, 5 figures, submitted to 64th IEEE Conference on Decision and Control

Journal ref 2025 IEEE 64th Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 43 篇

2602.02475 2026-02-03 cs.AI 89%

AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

AgentRx: 从执行轨迹诊断AI代理故障

Shraddha Barke, Arnav Goyal, Alind Khare, Avaljot Singh, Suman Nath, Chetan Bansal

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 AgentRx通过自动化诊断框架,从执行轨迹中定位AI代理的关键故障步骤,并提升跨领域的故障归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-02-03 cs.AI 86%

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02395 2026-02-03 cs.LG cs.AI cs.CR cs.MA 86%

David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning

大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持

Samuel Nellessen, Tal Kachman

机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)

专题命中 Agent评测 :agent(title);autonomous agent(abstract);tool use(abstract);agentic(abstract)

AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。

Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06007 2026-02-03 cs.CL 85%

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

不要破坏缓存:对长周期智能体任务中提示缓存的评估

Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);function calling(abstract);分类 cs.CL

AI总结 本文评估了提示缓存对长周期智能体任务的影响,发现通过策略性缓存控制可显著降低API成本并提升响应速度。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00213 2026-02-03 cs.CR cs.AI cs.MA 85%

TessPay: Verify-then-Pay Infrastructure for Trusted Agentic Commerce

TessPay:可信代理商业的验证后支付基础设施

Mehul Goenka, Tejas Pathak, Siddharth Asthana

机构 * University of Oxford(牛津大学) Indian Institute of Technology, Delhi(德里印度理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 TessPay通过'验证后支付'架构解决代理商业中的信任缺口,提供统一的交易生命周期基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 83%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01271 2026-02-03 cs.LG 83%

From Intents to Actions: Agentic AI in Autonomous Networks

从意图到动作:自主网络中的代理AI

Burak Demirel, Pablo Soldati, Yu Wang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出一种代理AI系统,用于自主网络中将高层意图转化为具体控制动作,通过三个专门代理实现意图解析、优化和控制,以满足多样化的网络需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02524 2026-02-03 cs.RO 82%

Versatile Behavior Diffusion for Generalized Traffic Agent Simulation

多功能行为扩散用于通用交通代理模拟

Zhiyu Huang, Zixu Zhang, Ameya Vaidya, Yuxiao Chen, Chen Lv, Jaime Fernández Fisac

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) NVIDIA Research(NVIDIA研究)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15969 2026-02-03 cs.LG cs.AI 82%

LinearizeLLM: An Agent-Based Framework for LLM-Driven Exact Linear Reformulation of Nonlinear Optimization Problems

LinearizeLLM: 一个基于代理的框架,用于由LLM驱动的非线性优化问题的精确线性重 formulations

Paul-Niklas Ken Kandora, Simon Caspar Zeller, Aaron Jeremias Elsing, Elena Kuss, Steffen Rebennack

机构 * Institute for Operations Research, Karlsruhe Institute of Technology, Karlsruhe, Germany(运营研究学院,卡尔斯鲁厄技术大学) Institute for Information Systems, Reutlingen University, Reutlingen, Germany(信息系统研究所,鲁特lingen大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG;workflow(comments)

AI总结 LinearizeLLM通过基于代理的LLM框架实现非线性优化问题的自动精确线性化,显著提升线性化效率和准确性。

Comments This version is a major revision with a new abstract, updated workflow logic and description, an expanded instance set, additional numerical experiments, and corrected bibliography entries

详情

展开后加载摘要…

URL PDF HTML 收藏