arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 111 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 111 篇

2608.13606 2026-08-18 cs.AI cs.CL cs.LG cs.MA cs.MM 版本更新 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Yijun Chen, Buqiang Xu, Mingjun Mao, Xinjie Liu, Haoming Xu, Shuofei Qiao, Mengru Wang, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jason Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: http://mobilemem.openkg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26148 2026-08-04 cs.RO 版本更新 67%

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

具身智能体自主掌控:最小接口零样本智能体在视觉语言导航中可媲美工业级策略

Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学) Responsible AI Research Centre(负责任人工智能研究中心) CSIRO Data61(联邦科学与工业研究组织数据61中心) The University of Queensland(昆士兰大学)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract)

AI总结 本研究提出智能具身控制,以零样本导航为测试平台,评估三种智能体框架,发现最小接口下部分框架可媲美工业级策略,同时揭示模型、框架与接口对具身智能体的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00333 2026-07-15 cs.CR 版本更新 67%

(A)I Sees What You Don't: Exploiting New Attack Surfaces in Third-Party Mobile Agents

(AI)看见你看不见的:利用第三方移动代理中的新攻击面

Zidong Zhang, Zhentao Xie, Wenrui Diao, Jianliang Wu

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)

AI总结 本文识别了第三方移动代理在屏幕感知和通道滥用方面的两种新攻击面,并设计了七种具体攻击,证明恶意应用可在无权限下劫持代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01830 2026-07-14 cs.RO 版本更新 67%

What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework

基于强化学习的目标导航方法中什么重要?实证研究与统一框架

Hongze Wang, Boyang Sun, Jiaxu Xing, Fan Yang, Marco Hutter, Dhruv Shah, Davide Scaramuzza, Marc Pollefeys

机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) Microsoft, Switzerland(微软公司)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04412 2026-08-11 cs.AI cs.CL cs.HC 版本更新 62%

Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents

超越像素:探索面向基于大语言模型的智能体的DOM下采样

Thassilo M. Schiepanski, Nicholas Piël

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。

Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20482 2026-08-05 cs.AI cs.CL 版本更新 62%

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对用户指令不明确时网络代理需从浏览历史推断上下文的问题,引入PersonaTrail基准及偏好感知上下文记忆框架PACMem,利用浏览轨迹评估代理,实验证明PACMem优于现有基于记忆的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15673 2026-08-05 cs.AI cs.LG 版本更新 62%

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 62%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25170 2026-07-17 cs.LG cs.AI cs.ET cs.RO 版本更新 62%

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术

Kordel K. France, Ovidiu Daescu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。

Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 62%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07332 2026-06-11 cs.LG cs.AI 版本更新 62%

Grounding Computer Use Agents on Human Demonstrations

基于人类演示的计算机使用智能体基础构建

Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究) University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 61%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL;agentic(comments)

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 57%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16024 2026-08-19 cs.AI 版本更新 57%

ScreenSearch: Uncertainty-Aware OS Exploration

ScreenSearch: 带有不确定性的操作系统探索

Michael Solodko, Justin Wagle

机构 * Microsoft(微软)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 ScreenSearch通过结合结构化屏幕检索与基于不确定性的PUCT图强化学习,在大规模桌面探索中有效平衡探索与承诺,生成具有跨应用多样性的探索语料库。

Comments 22 pages, 8 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05106 2026-08-18 cs.SE 版本更新 57%

RepoTrace: Browser-Assisted Evidence Collection for GitHub Research Datasets

RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集

Xue Yao, Zehua Zhang, Jiatong Liu, Yongqiang Tian

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE

AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。

Comments 6 pages. Accepted to the ISSTA 2026 Tool Demonstrations Track; published in the Companion Proceedings of SPLASH Companion '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26148 2026-08-12 cs.HC cs.CL 版本更新 57%

Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

超越截图:评估VLMs对UI动画的理解

Chen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.CL

AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08005 2026-08-11 cs.LG 版本更新 57%

Preference Redirection via Attention Concentration: An Attack on Computer Use Agents

通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击

Dominik Seip, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.LG

AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。

Journal ref Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04009 2026-08-10 cs.CL 版本更新 57%

SocietyBench: Forecasting Counterfactual Social-World Evolution

SocietyBench:反事实社会世界演化预测

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文推出SocietyBench基准,通过构建反事实社会世界,测试LLMs预测社会事件的概率校准与时间准确性,发现前沿LLMs表现远逊于基准,智能体框架未提升性能,强调多事件评估的必要性。

Comments Project page: https://co-minder.github.io/Societybench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05597 2026-08-10 cs.LG 版本更新 57%

AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents

AsyncWebRL: 面向视觉网页智能体的高效多步强化学习

Hao Bai, Rui Yang, Chenlu Ye, Spencer Whitehead, Aviral Kumar, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) CMU(卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。

Comments Updated logo and code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26041 2026-07-31 cs.AI cs.CV 版本更新 57%

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 57%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14925 2026-07-23 cs.LG cs.NI 版本更新 57%

Self-Explaining Reinforcement Learning for Mobile Network Resource Allocation

用于移动网络资源分配的自解释强化学习

Konrad Nowosadko, Franco Ruggeri, Ahmad Terra

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 研究移动网络资源分配问题,核心方法是用自解释神经网络参数化PPO智能体策略并聚合局部解释为全局解释,主要贡献是性能接近最优深度学习方法且显著优于启发式方法,全局解释相关性强,在高风险强化学习中有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11063 2026-07-22 cs.AI 版本更新 57%

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。

Comments ACM International Conference on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14079 2026-07-22 cs.AI 版本更新 57%

FormGym: Doing Paperwork with Agents

FormGym:用智能体完成文书工作

Matthew Toles, Rattandeep Singh, Isaac Song, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :tool-use(abstract);分类 cs.AI

AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 57%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04334 2026-07-21 cs.AI 版本更新 57%

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖

Guijia Zhang, Yuxun Chen, Yuheng Qi, Harry Yang

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12625 2026-07-16 cs.CL cs.CV 版本更新 57%

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

KnowAct-GUIClaw:深度理解、完美执行,具有自我进化记忆和技能的个人GUI助手

Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 针对OpenClaw的不足,提出深度理解、完美执行范式,介绍KnowAct-GUIClaw框架,通过多系统实验验证其在效率、准确性和跨平台适应性方面的优势,且知识记忆和执行技能可跨基础模型迁移。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏