arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2971 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2971 篇

2605.28116 2026-05-28 cs.CR cs.AI cs.CL 62%

MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content

MIRAGE:通过用户生成内容对移动GUI代理的上下文感知提示注入

Ruoqi Guo, Yi Liu, Gelei Deng, Yiheng Xiong, Yuekang Li, Ying Zhang, Leo Yu Zhang, Lida Zhao, Ji Jie, Yuxiao Lu

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) University of New South Wales(新南威尔士大学) Wake Forest University(威克森林大学) Independent Researcher(独立研究者)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MIRAGE管道,通过将攻击者控制的文本嵌入用户生成内容区域,在不修改代理、应用或操作系统的情况下,对视觉语言模型驱动的移动GUI代理实现高成功率的提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01576 2026-05-26 cs.LG cs.AI cs.CV 62%

Generative Visual Code Mobile World Models

生成式视觉代码移动世界模型

Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

机构 * Trillion Labs(万亿实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出通过单一视觉语言模型预测可执行网页代码来生成移动GUI下一状态,结合文本和视觉世界模型优势,实现高保真视觉生成与精确文本渲染。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20299 2026-05-21 cs.LG cs.AI cs.RO 62%

Mechanisms of Misgeneralization in Physical Sequence Modeling

物理序列建模中泛化错误的机制

Kento Nishi, Raphael Tang, Karun Kumar, Core Francisco Park, Hidenori Tanaka

机构 * Harvard College(哈佛大学) Harvard John A. Paulson School of Engineering and Applied Sciences(哈佛大学约翰·A·保罗森工程与应用科学学院) Comcast AI CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能计划) Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(人工智能物理研究组,NTT研究公司,美国加利福尼亚州山景城) Microsoft(微软)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了物理序列建模中由于局部误差传播导致的物理泛化错误,提出了一种数据偏差核来预测物理量的质量变化,并提出了基于核的干预策略。

Comments Preprint. kentonishi.com/physical-misgeneralization

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17439 2026-05-20 cs.SE cs.AI 62%

DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

DiagEval: 用于通过GUI代理进行可靠软件评估的轨迹条件诊断

Sirui Hong, Zhijie Liu, Tengfei Li, Wei Tao, Yifan Wu, Chenglin Wu

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出DiagEval,一种基于轨迹的诊断评估协议,用于在GUI代理评估交互式软件后失败时进行诊断。通过重用失败轨迹选择针对性的诊断探针,并将结果聚合为内部归因信号,从而提高准确性,优于基于重试的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06807 2026-05-19 cs.RO cs.AI cs.LG 62%

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav:基于超像素图的约束放松用于过约束环境中的导航

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park

机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SuReNav方法,通过超像素图构建区域约束,利用图神经网络实现安全高效导航,适用于半静态环境中过约束规划问题,提升导航的人类类比性能。

Comments Accepted by ICRA 2026. Code and videos are available at https://sure-nav.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 62%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV 62%

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV 62%

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09317 2026-05-12 cs.CL cs.CV cs.LG 62%

Mem-W: Latent Memory-Native GUI Agents

Mem-W: 基于潜在记忆的原生GUI代理

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 Mem-W通过将记忆作为连续上下文的一部分,改进GUI代理的长期任务执行能力,实验证明其在多个导航基准测试中提升了性能,最高提升达+30.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24954 2026-05-12 cs.LG cs.AI cs.CV 62%

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni:高效且开放的多模态智能

NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Bilal Kartal, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

机构 * NVIDIA

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 Nemotron 3 Nano Omni是首个原生支持音频输入的多模态模型,通过架构、数据和训练方法的改进,在所有模态上均实现了更准确的性能,同时提供更低的推理延迟和更高的吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08261 2026-05-12 cs.SE cs.AI 62%

Computer Use at the Edge of the Statistical Precipice

在统计悬崖边缘的计算机使用

Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文指出现有交互环境评估方法存在系统性缺陷,提出PRISM原则设计更真实的环境,并开发新的聚合框架以提升CUA评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07134 2026-05-11 cs.CL cs.AI 62%

Region4Web: Rethinking Observation Space Granularity for Web Agents

Region4Web: 重新思考网页代理的观察空间粒度

Donguk Kwon, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Region4Web提出通过功能区域划分重构AXTree,以更紧凑的信息基础提升网页代理任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26020 2026-04-30 cs.CL cs.AI 62%

Training Computer Use Agents to Assess the Usability of Graphical User Interfaces

训练计算机使用代理以评估图形用户界面的可用性

Alice Gao, Weixi Tong, Rishab Vempati, Katharina Reinecke, R. Benjamin Shapiro, Tianyi Zhang, Jason Wu

机构 * University of Washington(华盛顿大学) Purdue University(普渡大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种新型机器学习方法,通过优先处理关键交互流程、模拟人类交互并预测可用性评分,训练计算机使用代理评估GUI可用性,优于大模型并在合成和真实UI中产生真实批判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC 62%

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08605 2026-04-16 cs.CL cs.AI 62%

ExpSeek: Self-Triggered Experience Seeking for Web Agents

ExpSeek:面向Web代理的自触发经验寻求

Wenyuan Zhang, Xinghua Zhang, Haiyang Yu, Shuaiyi Nie, Bingli Wu, Juwei Yue, Tingwen Liu, Yongbin Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab , Alibaba Group(阿里云实验室,阿里巴巴集团)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 ExpSeek通过自触发机制实现Web代理的经验主动获取,提升交互能力,实验表明其在不同规模模型上均取得显著性能提升。

Comments ACL 2026 Findings, the code is accessible at https://github.com/WYRipple/ExpSeek

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12666 2026-04-15 cs.LG cs.CL cs.HC 62%

From Imitation to Discrimination: Progressive Curriculum Learning for Robust Web Navigation

从模仿到鉴别:面向鲁棒网络导航的渐进课程学习

Chuang Peng, Wei Zhang, Renshuai Tao, Xinhao Zhang, Jian Yang

机构 * Beijing Jiaotong University(北京交通大学) Beihang University(北京航空航天大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Triton数据集和渐进训练课程,通过结构-语义硬负样本挖掘和双代理共识流程构建,提升网络导航中对复杂页面的鉴别能力与泛化能力,最终在Mind2Web上验证了专用数据课程优于单纯参数规模的优势。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15803 2026-04-14 cs.LG cs.AI 62%

WebLLM: A High-Performance In-Browser LLM Inference Engine

WebLLM:一种高性能的浏览器内LLM推理引擎

Charlie F. Ruan, Yucheng Qin, Akaash R. Parthasarathy, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09604 2026-04-14 cs.AI cs.LG 62%

LLMs for Text-Based Exploration and Navigation Under Partial Observability

基于部分可观测性的文本基于探索与导航中的大型语言模型

Stephan Sandfuchs, Maximilian Melchert, Jörg Frochte

机构 * AKIS -- Interdisciplinary Institute for Applied AI and Data Science Ruhr(AKIS——鲁尔跨学科应用人工智能与数据科学研究所) Bochum University of Applied Sciences(波鸿应用科学大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在部分可观测环境下作为纯文本控制器的可行性,评估了九种不同LLM在探索和导航任务中的表现,发现推理调优模型在导航任务中表现更可靠,但效率仍低于理想路径。

Comments 15 pages, (to be published Springer Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering [LNICST] )

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09155 2026-04-13 cs.LG cs.AI 62%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13615 2026-03-19 cs.AI cs.CL cs.HC 62%

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07432 2026-03-10 cs.CV cs.CL cs.HC cs.LG 62%

Generalization in Online Reinforcement Learning for Mobile Agents

移动端智能体在线强化学习中的泛化能力

Li Gu, Zihuan Jiang, Zhixiang Chi, Huan Liu, Ziqiang Wang, Yuanhao Yu, Glen Berseth, Yang Wang

机构 * Mila – Québec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能主席) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AndroidWorld-Generalization基准,通过整合GRPO与可扩展回放系统,评估移动端智能体在未见任务实例、模板和应用上的泛化能力,并展示RL在提升性能上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04964 2026-03-06 cs.CL cs.LG 62%

Replaying pre-training data improves fine-tuning

重放预训练数据提高微调

Suhas Kotha, Percy Liang

机构 * Stanford University(斯坦福大学)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 通过重放预训练数据提升微调效果,提高目标任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16641 2026-02-18 quant-ph cs.AI cs.LG 62%

Hybrid Reward-Driven Reinforcement Learning for Efficient Quantum Circuit Synthesis

混合奖励驱动强化学习用于高效量子电路综合

Sara Giordano, Kornikar Sen, Miguel A. Martin-Delgado

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合奖励驱动强化学习方法,用于高效合成量子电路,通过结合静态奖励和动态惩罚,优化电路深度和门数,提升量子电路综合效率。

Comments 35 pages, 7 figures, color figures

Journal ref Quantum Mach. Intell. 8, 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14865 2026-02-17 cs.AI cs.SE 62%

EmbeWebAgent: Embedding Web Agents into Any Customized UI

EmbeWebAgent:将Web代理嵌入到任何定制的UI中

Chenyang Ma, Clyde Fare, Matthew Wilson, Dave Braines

机构 * IBM Research Europe(IBM欧洲研究院) University of Oxford(牛津大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 EmbeWebAgent通过轻量前端钩子和可重用后端工作流,将Web代理嵌入定制UI,支持混合粒度动作并实现鲁棒的多步骤行为。

Comments Technical Report; Live Demo: https://youtu.be/Cy06Ljee1JQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10962 2026-02-06 cs.LG cs.AI 62%

WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering

WebSTAR: 可扩展的数据合成用于计算机使用代理的步级过滤

Yifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 WebSTAR通过步级过滤技术合成高质量数据,构建了WebSTAR和WebSCORE数据集,并训练了高效的过程奖励模型StepRM,提升计算机使用代理的训练效果和部署效率。

Comments Project website: https://yifei-he.github.io/webstar-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03792 2026-02-04 cs.CR cs.AI cs.CL 62%

WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents

WebSentinel: 检测和定位网页代理中的提示注入攻击

Xilong Wang, Yinuo Liu, Zhun Wang, Dawn Song, Neil Gong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 WebSentinel通过两步方法有效检测和定位网页代理中的提示注入攻击,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 62%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 62%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12842 2025-11-25 cs.LG cs.CL 62%

GEM: Gaussian Embedding Modeling for Out-of-Distribution Detection in GUI Agents

GEM:用于GUI代理出界检测的高斯嵌入建模

Zheng Wu, Pengzhou Cheng, Zongru Wu, Lingzhong Dong, Zhuosheng Zhang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 GEM通过高斯混合模型提升GUI代理出界检测的准确率,实现23.70%的精度提升,同时保持训练和测试时间的增加可控。

详情

展开后加载摘要…

URL PDF HTML 收藏