Self-Organizing Maps as a Storage and Transfer Mechanism in Reinforcement Learning
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments 7 pages, 7 figures, presented at ALA Workshop, FAIM, Stockholm, 2018
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments 7 pages, 7 figures, presented at ALA Workshop, FAIM, Stockholm, 2018
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
Comments * FB, LDJF, DK, MV and JA contributed equally to the work. Accepted as a conference paper at the European Conference on Mobile Robotics 2017 (ECMR 2017), 6 pages, 3 figures
Journal ref 2017 European Conference on Mobile Robots (ECMR)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
Comments ICRA 2018
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments updated with improved content and more experinemnts
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Paper accepted at 32nd AAAI Conference on Artificial Intelligence, AAAI 2018, New Orleans, Louisiana, USA
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
Comments Camera ready version for IROS 2017
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG、cs.SE
Comments SE4ML: Software Engineering for Machine Learning (NIPS 2014 Workshop) accepted-papers" target="_blank" rel="noopener">https://sites.google.com/site/software4ml/accepted-papers
专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI、cs.SE
Comments 7 pages, for associated code repositories see https://github.com/THeK3nger/gridworld and https://github.com/THeK3nger/unity-cogbot
路由在最具价值处最不可学习:Web智能体的表示路由边界
机构 * University College London(伦敦大学学院) ; Holistic AI
专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.CL
AI总结 该研究针对Web智能体的观察模式路由问题,发现路由在智能体最需处因标签不足而不可学,固定合适模式的效果优于多数路由策略,仅稀疏单元有例外。
Comments Preprint. Under review at the Second Workshop for Research on Agent Language Models (REALM), EMNLP 2026 (non-archival track)
信号驱动观测:面向长程任务的Web智能体
机构 * University of Cambridge(剑桥大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL;agentic(comments)
AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。
Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026
基于Web代理的权限声明
机构 * University of Oxford(牛津大学) ; Institute for Decentralized AI(去中心化人工智能研究所) ; Centre for the Governance of AI(人工智能治理中心) ; Coral Protocol(珊瑚协议) ; Cooperative AI Foundation(协作人工智能基金会) ; Webair ; Johns Hopkins University(约翰霍普金斯大学) ; Witan Labs(Witan实验室) ; Stanford University(斯坦福大学) ; Microsoft(微软) ; UT Austin(得克萨斯大学奥斯汀分校)
专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI
AI总结 本文提出 agent-permissions.json,一种轻量级声明,用于规范 Web 代理的交互权限,以提升自动化应用与网站所有者的协调性。
Comments Authored by the Lightweight Agent Standards Working Group https://las-wg.org/
专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI
Comments agent, mobile control, SOP, human-machine interaction
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI;autonomous agent(comments)
Comments The paper has been accepted to be presented in 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021), May 3-7, London, UK (demo track)
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
作为具有可证保证的在线随机最短路径导航的神谕的Dijkstra算法
机构 * King Fahd University of Petroleum and Minerals (KFUPM)(法赫德国王石油与矿产大学) ; Islamic University of Madinah(麦地那伊斯兰大学) ; Universitas Muhammadiyah Yogyakarta(日惹穆罕默迪亚大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本研究提出DORA算法,基于Dijkstra算法的可证保证特性,实现高效安全的在线随机最短路径导航,性能与最优值迭代相当且规划工作量显著减少,接触率满足预算要求。
ScreenSearch: 带有不确定性的操作系统探索
机构 * Microsoft(微软)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 ScreenSearch通过结合结构化屏幕检索与基于不确定性的PUCT图强化学习,在大规模桌面探索中有效平衡探索与承诺,生成具有跨应用多样性的探索语料库。
Comments 22 pages, 8 figures, 21 tables
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE
AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。
Comments 6 pages. Accepted to the ISSTA 2026 Tool Demonstrations Track; published in the Companion Proceedings of SPLASH Companion '26
Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。
SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。
超越截图:评估VLMs对UI动画的理解
机构 * University of Michigan(密歇根大学)
专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.CL
AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。
Comments Published in ACL 2026 Findings
RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。
MELLON——面向在线导航的多模态增强型大语言模型
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。
穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统
机构 * Central South University(中南大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。
Comments Accepted by IEEE VIS'26
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.LG
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
AndroidReality:移动智能体距离真实世界还有多远?
机构 * Arizona State University(亚利桑那州立大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出基于扰动的框架AndroidReality,构建含可控扰动的移动基准测试,揭示移动智能体的鲁棒性差距,提出TTIR机制缓解故障,确立基准扰动的实用价值。
CoCoNav:面向人群环境中安全机器人导航的保形控制
机构 * The University of Manchester(曼彻斯特大学) ; Italian Institute of Technology(意大利技术研究院) ; Genisom AI ; University of Warwick(华威大学) ; Newcastle University(纽卡斯尔大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG
AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables
通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.LG
AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。
Journal ref Conference on Language Modeling (COLM) 2026