arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-20 至 2026-02-20 共收录 84 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 3 篇

2602.16855 2026-02-20 cs.AI cs.CL 84%

Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents

Mobile-Agent-v3.5: 多平台基础图形用户界面代理

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou, Xuhao Hu, Feiyu Gao, Junjie Cao, Zihua Wang, Zhiyuan Chen, Jitong Liao, Qi Zheng, Jiahui Zeng, Ze Xu, Shuai Bai, Junyang Lin, Jingren Zhou, Ming Yan

专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 GUI-Owl-1.5通过多平台支持和创新算法在GUI任务中取得突破性成绩。

Comments 25 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11337 2026-02-20 cs.RO cs.AI cs.CV 57%

MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation

MolmoSpaces: 一个大规模的开放式生态系统用于机器人导航与操作

Yejin Kim, Wilbert Pumacay, Omar Rayyan, Max Argus, Winson Han, Eli VanderBilt, Jordi Salvador, Abhay Deshpande, Rose Hendrix, Snehal Jauhri, Shuo Liu, Nur Muhammad Mahi Shafiullah, Maya Guru, Ainaz Eftekhar, Karen Farley, Donovan Clay, Jiafei Duan, Arjun Guru, Piper Wolters, Alvaro Herrasti, Ying-Chun Lee, Georgia Chalvatzaki, Yuchen Cui, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 MolmoSpaces是一个大规模开放式生态系统,用于支持机器人导航与操作的大规模基准测试,包含230k多样化的室内环境和130k丰富标注的物体资产,通过8个任务的基准测试验证了其在仿真到现实中的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17515 2026-02-20 cs.RO 50%

RA-Nav: A Risk-Aware Navigation System Based on Semantic Segmentation for Aerial Robots in Unpredictable Environments

RA-Nav:基于语义分割的面向不确定环境的面向风险的导航系统

Ziyi Zong, Xin Dong, Jinwu Xiang, Daochun Li, Zhan Tu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 RA-Nav通过语义分割实时识别障碍物并分类,构建风险地图以实现安全高效的路径规划,验证了在突发障碍物场景下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 3 篇

2602.16444 2026-02-20 cs.RO cs.AI cs.LG 81%

RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation

RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务

Yixue Zhang, Kun Wu, Zhi Gao, Zhen Zhao, Pei Ren, Zhiyuan Xu, Fei Liao, Xinhua Wang, Shichao Fan, Di Wu, Qiuxuan Feng, Meng Li, Zhengping Che, Chang Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Beijing Institute of Technology(北京理工大学) The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17442 2026-02-20 cs.AI cs.IR 70%

WarpRec: Unifying Academic Rigor and Industrial Scale for Responsible, Reproducible, and Efficient Recommendation

WarpRec: 统一学术严谨性与工业规模以实现负责任、可重复和高效的推荐

Marco Avolio, Potito Aghilar, Sabino Roccotelli, Vito Walter Anelli, Chiara Mallamaci, Vincenzo Paparella, Marco Valentini, Alejandro Bellogín, Michelantonio Trizio, Joseph Trotta, Antonio Ferrara, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学) Wideverse ISTI-CNR(意大利国家研究委员会ISTI分部) UAM(马德里自治大学) OVS

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 WarpRec通过统一学术严谨性与工业规模,实现负责任、可重复和高效的推荐系统,提供高性能框架和可持续的推荐系统架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10181 2026-02-20 cs.LG astro-ph.EP 57%

Reinforcement Learning to Discover a North-East Monsoon Index for Rainfall Prediction in Thailand

利用强化学习发现泰国东北季风指数以预测降雨

Kiattikun Chobtham

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文利用强化学习优化东北季风指数,提升泰国降雨预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 15 篇

2602.17046 2026-02-20 cs.AI 83%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17017 2026-02-20 cs.AI 79%

Sales Research Agent and Sales Research Bench

销售研究代理与销售研究基准

Deepanjan Bhol

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。

Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17641 2026-02-20 cs.LG cs.AI 79%

FAMOSE: A ReAct Approach to Automated Feature Discovery

FAMOSE:一种用于自动化特征发现的ReAct方法

Keith Burghardt, Jienan Liu, Sadman Sakib, Yuning Hao, Bo Li

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 62%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16747 2026-02-20 cs.LG cs.AI 62%

LiveClin: A Live Clinical Benchmark without Leakage

LiveClin: 一种无泄漏的实时临床基准

Xidong Wang, Shuqi Guo, Yue Shen, Junying Chen, Jian Wang, Jinjie Gu, Ping Zhang, Lei Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Ant Healthcare, Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17217 2026-02-20 cs.AI 57%

Continual learning and refinement of causal models through dynamic predicate invention

通过动态谓词发明实现因果模型的持续学习与完善

Enrique Crespo-Fernandez, Oliver Ray, Telmo de Menezes e Silva Filho, Peter Flach

机构 * University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16938 2026-02-20 cs.CL 57%

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilier

机构 * Google(谷歌)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 57%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.SE

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10273 2026-02-20 q-fin.PM q-fin.MF q-fin.TR 50%

Optimal Portfolio Choice with Cross-Impact Propagators

具有交叉影响传播器的最优投资组合选择

Eduardo Abi Jaber, Eyal Neuman, Sturmius Tuschmann

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于矩阵值Volterra传播器的最优投资组合选择模型,通过求解随机Fredholm方程组,分析了交叉影响对投资策略及阿尔法衰减的相互作用。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17169 2026-02-20 cs.AR 50%

SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models

SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化

Yuhuan Xia, Tun Li, Hongji Zhou, Xianfa Zhou, Chong Chen, Ruiyu Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16858 2026-02-20 cs.PF cs.AR 50%

GDEV-AI: A Generalized Evaluation of Deep Learning Inference Scaling and Architectural Saturation

GDEV-AI: 对深度学习推理扩展性和架构饱和度的通用评估

Kathiravan Palaniappan

专题命中 Agent评测 :planning(abstract)

AI总结 GDEV-AI通过基准测试分析CPU推理的可扩展性和架构饱和度,揭示传统CPU和现代架构在吞吐量和延迟上的差异,为异构数据中心的容量规划提供实证支持。

Comments 14 pages, 18 figures, 20 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16211 2026-02-20 econ.TH 50%

Equity in auction design with unit-demand agents and non-quasilinear preferences

拍卖设计中的公平性:单位需求代理与非准线性偏好

Tomoya Kazumura, Debasis Mishra, Shigehiro Serizawa

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于公平性的拍卖机制,该机制在单位需求代理和非准线性偏好下实现策略可行、个体理性、同等对待、无浪费和无补贴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10798 2026-02-20 q-fin.TR math.OC 50%

Trading in CEXs and DEXs with Priority Fees and Stochastic Delays

在CEX和DEX中使用优先费用和随机延迟的交易

Philippe Bergault, Yadh Hafsi, Leandro Sánchez-Betancourt

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种结合连续控制与脉冲干预的混合框架,用于在CEX和DEX中优化交易策略,通过优先费用选择最优管理延迟风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13528 2026-02-20 cs.HC cs.SY eess.SY 50%

Human-Like Trajectories Generation via Receding Horizon Tracking Applied to the TickTacking Interface

通过递推视界跟踪生成类人轨迹应用于TickTacking界面

Daniele Masti, Stefano Menchetti, Çağrı Erdem, Giorgio Gnecco, Davide Rocchesso

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过递推视界方法在TickTacking界面中生成类人轨迹,通过分析用户行为特征提升人机交互的直观性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他Agent 3 篇

2512.01295 2026-02-20 cs.CR 82%

Systems Security Foundations for Agentic Computing

面向代理计算的安全基础

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract)

AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17536 2026-02-20 physics.acc-ph cs.AI 57%

Toward a Fully Autonomous, AI-Native Particle Accelerator

迈向完全自主的、原生AI粒子加速器

Chris Tennant

机构 * Jefferson Laboratory(杰弗逊实验室)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文提出通过AI共同设计构建完全自主的粒子加速器,旨在实现自主运行和最大化性能。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17030 2026-02-20 cs.CV cs.RO 50%

Patch-Based Spatial Authorship Attribution in Human-Robot Collaborative Paintings

基于补丁的空间作者归属在人类-机器人协作绘画中

Eric Chen, Patricia Alves-Oliveira

机构 * Robotics, University of Michigan, Ann Arbor, Michigan, United States(机器人学,密歇根大学,安娜堡,密歇根,美国)

专题命中 其他Agent :agentic(abstract)

AI总结 本文提出了一种基于补丁的空间作者归属方法,用于人类-机器人协作绘画,通过实验验证在数据稀缺情况下有效区分混合作者身份。

详情

展开后加载摘要…

URL PDF HTML 收藏