PRO-CUA: Process-Reward Optimization for Computer Use Agents
PRO-CUA: 面向计算机使用代理的过程奖励优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出PRO-CUA框架,通过过程奖励模型和逐步骤强化学习,解决计算机使用代理训练中的模仿瓶颈和稀疏奖励问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
PRO-CUA: 面向计算机使用代理的过程奖励优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出PRO-CUA框架,通过过程奖励模型和逐步骤强化学习,解决计算机使用代理训练中的模仿瓶颈和稀疏奖励问题。
Mobile-Aptus: 基于MLLM的手机使用代理中的置信度驱动的主动与鲁棒交互
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; GenAI, Meta(Meta的GenAI)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 针对手机使用代理中的过度执行和过度请求问题,提出一种置信度驱动的主动与鲁棒交互框架,通过监督微调和置信度偏差校正实现最优性能。
Comments Accepted by TASLP
经典与神经采样算法在机器人导航中的性能比较
机构 * dept. of Economics Oran2 Mohamed BenAhmed University(经济系奥兰2莫哈梅德·本·阿赫迈德大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本文在含凸凹障碍物的环境中比较了RRT*、Neural RRT*和Neural Informed RRT*三种算法,发现神经引导规划器能生成更短(最多14%)和更平滑(55-75%)的路径,其中Neural Informed RRT*综合性能最优。
Journal ref Presented at The 3rd Edition of National Conference on Applications of Artificial Intelligence A2I' 26. 2026
AndroidDaily: 面向真实世界闭源应用的可验证移动GUI智能体基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; StepFun ; Waseda University(早稻田大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE
AI总结 针对闭源应用无法获取内部状态导致自动验证困难的问题,提出AndroidDaily基准(350个日常任务)和GRADE评估器(基于可观察外部指南的三层系统),实现无需内部状态的可验证评估,最强模型成功率为62.0%。
Comments 11 pages, 6 figures. Preprint
CFDTwin:用于ANSYS Fluent模拟的POD-NN代理建模的开源GUI和Python工具包
机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.LG
AI总结 本文介绍CFDTwin,一个开源Python包和桌面GUI,将参数采样、Fluent自动化、数据提取、降阶模型构建、神经网络训练、验证和预测封装为可重用工作流,用于ANSYS Fluent模拟的POD-NN代理建模。
Comments 9 pages, 3 figures
整流薛定谔桥匹配用于少步视觉导航
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; College of Computer Science, Chongqing University(重庆大学计算机学院) ; Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) ; Changchun GenY Technology Co., Ltd.(长春GenY科技有限公司)
专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI
AI总结 提出整流薛定谔桥匹配(RSBM)框架,利用速度场结构不变性和线性方差减少,在仅3步积分中实现高保真生成策略,满足具身AI低延迟需求。
Comments 18 pages, 7 figures, 10 tables. Code available at https://github.com/WuyangLuan/RSBM
MobileExplorer: 通过在线探索加速移动GUI代理的端侧推理
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出MobileExplorer框架,通过在线探索并行探测UI元素并记录为结构化记忆,结合两级回滚机制,减少推理步骤和延迟,提升移动GUI代理的端侧部署效率。
通过视觉反馈学习具有空间推理能力的 GUI 定位
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft(微软)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.CL
AI总结 本文提出将 GUI 定位重构为交互式搜索任务,利用多步在线强化学习训练 GUI-Cursor 模型,通过光标视觉反馈提升空间推理能力,在 GUI 定位和代理任务上超越强基线。
Comments Accepted at ICML 2026
Claw-Anything: 对更广泛访问用户数字世界的始终在线个人助手的基准测试
机构 * Beijing Institute of Technology(北京理工大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出Claw-Anything基准测试,通过扩展长期活动历史、相互依赖的后端服务以及跨多设备的GUI和CLI交互三个维度,评估大型语言模型代理在始终在线环境下的性能,发现GPT-5.5仅达34.5% pass@1,并发布自动化数据生成管道提升基线模型23.7%。
MASt3R-Nav: 相对3D地图中的WayPixel导航
机构 * Robotics Research Center, IIIT-Hyderabad, India(1 罗斯科技研究中心,IIIT-海得拉巴,印度) ; University of Heidelberg(2 海德堡大学) ; MBZUAI(3 MBZUAI)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 提出一种基于像素相对连接性的地图表示,通过相对3D坐标系中的像素对应构建地图,并利用像素级图进行全局路径规划,训练控制器预测轨迹,实现高精度导航。
Comments 2026 IEEE International Conference on Robotics & Automation (ICRA)
AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化
机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) ; School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。
Comments Accepted in ICML 2026
CutVerse: 一个用于媒体后期制作编辑的组合式GUI代理基准测试
机构 * MIPG, Communication University of China(MIPG,中国传媒大学) ; National University of Singapore(新加坡国立大学) ; USEIT AI(USEIT人工智能)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本研究提出CutVerse,一个用于评估自主GUI代理在真实媒体后期制作环境中的能力的基准测试,揭示现有代理在复杂、长周期媒体后期制作工作流中的局限性。
AQuaUI: 用于GUI代理的视觉令牌减少方法基于自适应四叉树
机构 * UC Davis(加州大学戴维斯分校)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AQuaUI,一种无需训练的推理时GUI代理模型的视觉令牌减少方法,利用屏幕截图中的非均匀信息密度,通过自适应四叉树结构保持令牌位置以确保一致性,并通过条件四叉树算法提升多步骤GUI交互的时序一致性,实验表明其在准确性和效率之间取得了改进。
SimGym:一种用于电子商务A/B测试模拟的框架,使用基于流量的VLM代理
机构 * Shopify
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出SimGym框架,通过基于流量的VLM代理模拟电子商务A/B测试,解决真实测试周期长、风险高等问题,验证结果显示其能快速准确预测用户行为变化。
气味导航中通过记忆增强强化学习的流辅助铸造策略的出现
机构 * State Key Laboratory of Ocean Engineering, School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Shanghai 200240, People’s Republic of China(海洋工程国家重点实验室,海洋与土木工程学院,上海交通大学,上海200240,中华人民共和国) ; State Key Laboratory of Fluid Power and Mechatronic Systems, Department of Engineering Mechanics, Zhejiang University, Hangzhou 310027, People’s Republic of China(流体动力与机械系统国家重点实验室,工程力学系,浙江大学,杭州310027,中华人民共和国)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 研究通过记忆增强强化学习探讨了在动态流场中动物如何利用记忆长度和流条件优化气味搜索效率,发现智能体通过自适应调整搜索轨迹几何形状和启动铸造的浓度阈值来最大化成功概率。
OmniGUI: 评估多模态智能手机环境中的GUI代理的基准测试
机构 * XPeng Motors(小鹏汽车)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出OmniGUI基准测试,用于评估在多模态智能手机环境中GUI代理的能力,通过连续的多模态输入(包括静态图像、同步音频和视频片段)来模拟真实世界交互,发现当前模型在需要同步时间和听觉信号的环境中表现下降。
仅RGB的主动3D场景图生成用于室内移动机器人
机构 * Mobile Robotics Group (MRG)(移动机器人小组) ; Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种仅使用RGB输入的主动3D场景图生成方法,通过统一感知与规划的结构化表示,解决了传统方法对专用传感器的依赖问题,并在Replica数据集上验证了其有效性。
TClone:用于计算机使用代理的低延迟活GUI环境分叉
机构 * University of California, San Diego(加州大学圣迭戈分校) ; GenseeAI
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 TClone通过分离快速分支创建与持久快照,实现了对计算机使用代理的活GUI环境的低延迟版本控制,从而提高代理执行的安全性和质量。
基于 Rao-Blackwellized 粒子滤波器的目标推断
机构 * Mechanical \& Aerospace Engineering Department, University of Florida. ; Mathematics Department, Ohio University
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出利用改进的 Rao-Blackwellized 粒子滤波器推断移动智能体的目标,通过闭合环行为假设提升样本效率,并引入两种估计器评估对抗者恢复意图的能力。
Comments 6 pages, 3 figures. Accepted for presentation at the 23rd IFAC World Congress 2026, Busan, Republic of Korea, August 23-28, 2026. To appear in IFAC-PapersOnLine
ShopGym: 一个集成框架,用于电子商务网络代理的现实模拟和可扩展基准测试
机构 * North Carolina State University(北卡罗来纳州立大学) ; Shopify
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出ShopGym框架,通过模拟层ShopArena和基准层ShopGuru,实现电子商务网络代理的现实模拟与可扩展基准测试,验证了合成商店在结构属性和代理性能上的有效性。
Comments 32 pages, 10 figures
ProCompNav:基于比较判断的主动实例导航
机构 * GSAI, POSTECH(POSTECH人工智能研究所) ; CSE, POSTECH(POSTECH计算机科学与工程系) ; Oracle(Oracle公司)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 ProCompNav通过两阶段框架解决用户查询歧义问题,通过比较判断逐步缩小候选集,提升导航成功率并减少用户响应长度。
Comments Project page: https://tree-jhk.github.io/procompnav/ . Code: https://github.com/tree-jhk/procompnav/
自然语言驱动的网页执行自主智能体与集成安全保障
机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) ; Salesforce Inc(Salesforce公司)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出一种AI驱动的自动化测试框架,通过五个集成策略提升测试脚本生成成功率和导航可靠性,同时实现安全验证,检测认证绕过漏洞和输入验证缺陷。
Comments 6 pages, 4 figures, 5 tables, IEEE conference format
WARD: 用于对抗Web代理对抗提示注入的鲁棒防御
机构 * National University of Singapore(新加坡国立大学) ; University of Science(科学大学) ; Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 WARD通过WARD-Base和WARD-PIG数据集及A3T框架,实现高效鲁棒的Web代理防御,有效应对提示注入攻击,保持低误报率和高效运行。
Comments Code and models: https://github.com/caothientri2001vn/WARD-WebAgent
别点那个:教网络代理抵抗欺骗界面
机构 * Renmin University of China(中国人民大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出DUDE框架,通过混合奖励学习和不对称惩罚,结合经验总结,提升网络代理对欺骗界面的抵抗力,实验显示欺骗敏感度降低53.8%。
Comments Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables
与幻灯片对话:通过语言驱动的结构化数据操作实现高效幻灯片编辑
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Chung-Ang University(Chung-Ang 大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出Talk-to-Your-Slides,通过语言驱动的结构化数据操作实现高效幻灯片编辑,相较于基于图像的GUI方法,其在文本处理和格式任务中更快、更准确且成本更低。
Comments 30 pages, Accepted at ACL2026
WebTrap: 隐秘的中任务劫持攻击浏览器代理在导航过程中的行为
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; City University of Hong Kong(香港城市大学) ; City University of Macau(澳门城市大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 WebTrap通过多步骤指令融合引导实现浏览器代理在导航任务中的隐秘劫持,提升攻击成功率同时保持系统可用性。
Comments 31 pages, 4 figures, 10 tables. Code: https://github.com/liuyaojialiuyaojia/WebTrap
AgentProg: 通过程序引导的上下文管理赋能长周期GUI代理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AgentProg,通过将交互历史重构为程序结构,实现长周期GUI任务的高效上下文管理,实验表明其在AndroidWorld和扩展任务集上达到最优性能,并在长周期任务中保持稳健表现。
Comments 16 pages, 8 figures
WebGym: 通过现实任务扩大视觉网络代理的训练环境
机构 * Microsoft(微软) ; UIUC(伊利诺伊大学香槟分校) ; CMU(卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 WebGym通过大规模现实任务和异步轨迹采样系统提升视觉网络代理训练效果,使基座模型在分布外测试集上的成功率显著提升。
Comments Completed acknowledgements
NaviMaster: 学习GUI和具身导航任务的统一策略
机构 * East China Normal University(东华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; SenseTime Research(商汤科技研究院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出NaviMaster,通过统一框架整合GUI导航和具身导航,采用视觉目标轨迹收集管道、统一强化学习框架和距离感知奖励,提升泛化能力。
Comments ACL 2026 Main Camera Ready
具有强化学习的图形用户界面代理:迈向数字居民
机构 * Shandong University(山东大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。
Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents