arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2971 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2971 篇

1807.07530 2018-07-20 cs.LG cs.AI stat.ML 62%

Self-Organizing Maps as a Storage and Transfer Mechanism in Reinforcement Learning

Thommen George Karimpanal, Roland Bouffanais

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 7 figures, presented at ALA Workshop, FAIM, Stockholm, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06633 2018-06-13 cs.AI cs.CV cs.HC cs.LG cs.RO 62%

Acting Thoughts: Towards a Mobile Robotic Service Assistant for Users with Limited Communication Skills

Felix Burget, Lukas Dominique Josef Fiederer, Daniel Kuhner, Martin Völker, Johannes Aldinger, Robin Tibor Schirrmeister, Chau Do, Joschka Boedecker, Bernhard Nebel, Tonio Ball, Wolfram Burgard

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

Comments * FB, LDJF, DK, MV and JA contributed equally to the work. Accepted as a conference paper at the European Conference on Mobile Robotics 2017 (ECMR 2017), 6 pages, 3 figures

Journal ref 2017 European Conference on Mobile Robots (ECMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.10489 2018-05-21 cs.LG cs.AI cs.RO 62%

Self-supervised Deep Reinforcement Learning with Generalized Computation Graphs for Robot Navigation

Gregory Kahn, Adam Villaflor, Bosen Ding, Pieter Abbeel, Sergey Levine

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

Comments ICRA 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.02209 2018-04-10 cs.LG cs.AI 62%

Building Generalizable Agents with a Realistic and Rich 3D Environment

Yi Wu, Yuxin Wu, Georgia Gkioxari, Yuandong Tian

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments updated with improved content and more experinemnts

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07479 2017-11-22 cs.RO cs.AI cs.LG stat.ML 62%

Teaching a Machine to Read Maps with Deep Reinforcement Learning

Gino Brunner, Oliver Richter, Yuyi Wang, Roger Wattenhofer

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Paper accepted at 32nd AAAI Conference on Artificial Intelligence, AAAI 2018, New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.05533 2017-07-25 cs.RO cs.AI cs.LG 62%

Deep Reinforcement Learning with Successor Features for Navigation across Similar Environments

Jingwei Zhang, Jost Tobias Springenberg, Joschka Boedecker, Wolfram Burgard

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

Comments Camera ready version for IROS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.09831 2017-05-23 cs.CL cs.LG 62%

A Deep Compositional Framework for Human-like Language Acquisition in Virtual Environment

Haonan Yu, Haichao Zhang, Wei Xu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02215 2015-02-10 cs.LG cs.CY cs.SE 62%

Real World Applications of Machine Learning Techniques over Large Mobile Subscriber Datasets

Jobin Wilson, Chitharanj Kachappilly, Rakesh Mohan, Prateek Kapadia, Arun Soman, Santanu Chaudhury

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG、cs.SE

Comments SE4ML: Software Engineering for Machine Learning (NIPS 2014 Workshop) accepted-papers" target="_blank" rel="noopener">https://sites.google.com/site/software4ml/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
1307.3195 2013-07-12 cs.AI cs.SE 62%

Action-based Character AI in Video-games with CogBots Architecture: A Preliminary Report

Davide Aversa, Stavros Vassos

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI、cs.SE

Comments 7 pages, for associated code repositories see https://github.com/THeK3nger/gridworld and https://github.com/THeK3nger/unity-cogbot

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06171 2026-08-07 cs.CL 新提交 61%

Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

路由在最具价值处最不可学习:Web智能体的表示路由边界

Jiaming Wei, Zekun Wu, Adriano Koshiyama, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI

专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.CL

AI总结 该研究针对Web智能体的观察模式路由问题,发现路由在智能体最需处因标签不足而不可学,固定合适模式的效果优于多数路由策略,仅稀疏单元有例外。

Comments Preprint. Under review at the Second Workshop for Research on Agent Language Models (REALM), EMNLP 2026 (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 61%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL;agentic(comments)

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02371 2026-01-14 cs.CY cs.AI cs.MA cs.NI 61%

Permission Manifests for Web Agents

基于Web代理的权限声明

Samuele Marro, Alan Chan, Xinxing Ren, Lewis Hammond, Jesse Wright, Gurjyot Wanga, Tiziano Piccardi, Nuno Campos, Tobin South, Jialin Yu, Sunando Sengupta, Eric Sommerlade, Alex Pentland, Philip Torr, Jiaxin Pei

机构 * University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所) Centre for the Governance of AI(人工智能治理中心) Coral Protocol(珊瑚协议) Cooperative AI Foundation(协作人工智能基金会) Webair Johns Hopkins University(约翰霍普金斯大学) Witan Labs(Witan实验室) Stanford University(斯坦福大学) Microsoft(微软) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI

AI总结 本文提出 agent-permissions.json,一种轻量级声明,用于规范 Web 代理的交互权限,以提升自动化应用与网站所有者的协调性。

Comments Authored by the Lightweight Agent Standards Working Group https://las-wg.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04124 2024-01-18 cs.HC cs.AI 61%

MobileAgent: enhancing mobile control via human-machine interaction and SOP integration

Tinghe Ding

专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI

Comments agent, mobile control, SOP, human-machine interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06602 2021-03-12 cs.AI 61%

Symbolic Reinforcement Learning for Safe RAN Control

Alexandros Nikou, Anusha Mujumdar, Marin Orlic, Aneta Vulgarakis Feljan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI;autonomous agent(comments)

Comments The paper has been accepted to be presented in 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021), May 3-7, London, UK (demo track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 57%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17703 2026-08-19 cs.RO cs.AI math.OC 新提交 57%

Dijkstra as an Oracle for Online Stochastic Shortest Path Navigation with Provable Guarantees

作为具有可证保证的在线随机最短路径导航的神谕的Dijkstra算法

Mansur M. Arief, Ali Akarma, Ahmad Alfan Alfian Irfan

机构 * King Fahd University of Petroleum and Minerals (KFUPM)(法赫德国王石油与矿产大学) Islamic University of Madinah(麦地那伊斯兰大学) Universitas Muhammadiyah Yogyakarta(日惹穆罕默迪亚大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本研究提出DORA算法,基于Dijkstra算法的可证保证特性,实现高效安全的在线随机最短路径导航,性能与最优值迭代相当且规划工作量显著减少,接触率满足预算要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16024 2026-08-19 cs.AI 版本更新 57%

ScreenSearch: Uncertainty-Aware OS Exploration

ScreenSearch: 带有不确定性的操作系统探索

Michael Solodko, Justin Wagle

机构 * Microsoft(微软)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 ScreenSearch通过结合结构化屏幕检索与基于不确定性的PUCT图强化学习,在大规模桌面探索中有效平衡探索与承诺,生成具有跨应用多样性的探索语料库。

Comments 22 pages, 8 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 57%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05106 2026-08-18 cs.SE 版本更新 57%

RepoTrace: Browser-Assisted Evidence Collection for GitHub Research Datasets

RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集

Xue Yao, Zehua Zhang, Jiatong Liu, Yongqiang Tian

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE

AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。

Comments 6 pages. Accepted to the ISSTA 2026 Tool Demonstrations Track; published in the Companion Proceedings of SPLASH Companion '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 57%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26148 2026-08-12 cs.HC cs.CL 版本更新 57%

Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

超越截图:评估VLMs对UI动画的理解

Chen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.CL

AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 57%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 57%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08617 2026-08-11 cs.AI cs.HC 新提交 57%

Walking through Discussions: A Mobile Visual Analytics System for In-Situ Group Discussion Analysis

穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统

Yiping Sun, Ziyao Kang, Wei Zeng, Minli Wu, Jiazhi Xia

机构 * Central South University(中南大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。

Comments Accepted by IEEE VIS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08545 2026-08-11 cs.RO cs.LG 新提交 57%

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

结构化参数环境下用于鲁棒导航策略的课程生成

Prishita Ray

机构 * Cornell University(康奈尔大学)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.LG

AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07775 2026-08-11 cs.AI 新提交 57%

AndroidReality: How Far Are Mobile Agents from the Real World?

AndroidReality:移动智能体距离真实世界还有多远?

Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于扰动的框架AndroidReality,构建含可控扰动的移动基准测试,揭示移动智能体的鲁棒性差距,提出TTIR机制缓解故障,确立基准扰动的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07751 2026-08-11 cs.RO cs.LG 新提交 57%

CoCoNav: Conformal Control for Safe Robot Navigation in Crowds

CoCoNav:面向人群环境中安全机器人导航的保形控制

Cheng Guo, Mingzhe Ni, Zheng Liang, Yihu Ling, Yuan Hu, Michele Caprio, Daniele Pucci, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) Italian Institute of Technology(意大利技术研究院) Genisom AI University of Warwick(华威大学) Newcastle University(纽卡斯尔大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08005 2026-08-11 cs.LG 版本更新 57%

Preference Redirection via Attention Concentration: An Attack on Computer Use Agents

通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击

Dominik Seip, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.LG

AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。

Journal ref Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏